1 paper · 1 filter
Tianqianjin Lin, Xi Zhao, Xingyao Zhang +5
Reinforcement learning (RL) can refine the reasoning abilities of large language models (LLMs), but critically depends on a key prerequisite: the LLM can already generate high-util…