1 paper
Haitao Hong, Yuchen Yan, Xingyu Wu +5
Large language models (LLMs) have demonstrated remarkable performance in reasoning tasks, where reinforcement learning (RL) serves as a key algorithm for enhancing their reasoning…