1 paper · 1 filter
Bo Qian, Yuting Wu, Shuang Zeng +3
Credit assignment is challenging in long-horizon agentic reinforcement learning, where supervision often comes only from final rewards. Existing methods refine trajectory-level sig…