1 paper
Haoyang He, Zihua Rong, Kun Ji +5
Reinforcement learning (RL) has recently become the dominant paradigm for strengthening the reasoning abilities of large language models (LLMs). Yet the rule-based reward functions…