1 paper · 1 filter
Weiyuan Li, Aili Chen, Xintao Wang +11
Open-ended reinforcement learning often relies on rubric-based rewards for tasks without directly verifiable answers. Yet the policy and reward system form a dynamic feedback loop:…