1 paper
Henan Sun, Zehua Li, Haitao Hu +4
Reinforcement learning (RL) has emerged as a key paradigm for improving the reasoning capabilities of large language models (LLMs). However, existing reward systems, such as rule-b…