1 paper · 1 filter
Zhepeng Cen, Yihang Yao, William Han +2
Reinforcement learning (RL) has emerged as a powerful post-training technique to incentivize the reasoning ability of large language models (LLMs). However, LLMs can respond very i…