1 paper · 1 filter
Tiehua Mei, Minxuan Lv, Leiyu Pan +5
Reinforcement Learning with Verifiable Rewards (RLVR) improves reasoning in large language models but treats all correct solutions equally, potentially reinforcing flawed traces th…