1 paper
Shipeng Li, Zhiqin Yang, Shikun Li +7
Reinforcement learning with verifiable rewards (RLVR) has become a key technique for enhancing LLMs' reasoning abilities, yet its data inefficiency remains a major bottleneck. To a…