1 paper · 2 filters
Xiaoyin Chen, Jiarui Lu, Minsu Kim +6
Reinforcement learning (RL) has proven effective for fine-tuning large language models (LLMs), significantly enhancing their reasoning abilities in domains such as mathematics and…