1 paper · 1 filter
Zhangchen Xu, Yuetai Li, Fengqing Jiang +4
Reinforcement Learning (RL) has become a powerful tool for enhancing the reasoning abilities of large language models (LLMs) by optimizing their policies with reward signals. Yet,…