1 paper
Sijia Cui, Pengyu Cheng, Jiajun Song +6
Reinforcement Learning with Verifiable Rewards (RLVR) has significantly advanced the reasoning capacity of Large Language Models (LLMs). However, RLVR solely relies on final answer…