1 paper · 1 filter
Ziyuan Gao, Di Liang, Xianjie Wu +2
Existing reinforcement learning methods for Chain-of-Thought reasoning suffer from two critical limitations. First, they operate as monolithic black boxes that provide undifferenti…