1 paper · 1 filter
Tianyang Han, Hengyu Shi, Junjie Hu +3
Reinforcement learning with verifiable rewards has become a common way to improve explicit reasoning in large language models, but final-answer correctness alone does not reveal wh…