1 paper · 1 filter
Pengcheng Li, Zhengyang Zhang, Dongxu Zhang +2
Fine-grained credit assignment is a central challenge in reinforcement learning for long horizon LLM agents. Standard objectives often train from programmatically verifiable termin…