1 paper · 1 filter
Youling Huang, Tiankuo Xu, Jiaji Liu +10
Reinforcement learning for long-horizon agents typically relies on sparse outcome-based rewards. This leads to a severe cold-start problem, as early-stage policies often fail to so…