1 paper
Tianle Wang, Jiayu Liu, Zhongyuan Wu +4
Reinforcement learning with verifiable rewards (RLVR) has driven significant performance gains in reasoning-oriented large language models (LLMs), yet its internal training dynamic…