1 paper · 1 filter
Yihang Yao, Guangtao Zeng, Raina Wu +4
Reinforcement learning (RL) has emerged as a powerful paradigm for enhancing the reasoning capabilities of large language models (LLMs). While RL has demonstrated substantial perfo…