1 paper · 1 filter
Xinyu Tang, Qianggang Cao, Yurou Liu +13
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoni…