1 paper · 1 filter
Haoyu Zheng, Yun Zhu, Qing Wang +1
Recent agentic reinforcement learning methods use hindsight to complement sparse outcome rewards. However, a completed rollout can yield many such signals, leaving their appropriat…