1 paper · 1 filter
Yanzhi Zhang, Zhaoxi Zhang, Haoxiang Guan +6
Reinforcement learning has emerged as a powerful paradigm for post-training large language models (LLMs) to improve reasoning. Approaches like Reinforcement Learning from Human Fee…