1 paper
Yiran Guo, Lijie Xu, Jie Liu +2
Enhancing the reasoning capabilities of large language models effectively using reinforcement learning (RL) remains a crucial challenge. Existing approaches primarily adopt two con…