1 paper · 1 filter
Zhiyu Cao, Kaixin Wu, Mingjie Zhong +4
Recent developments in Large Language Models (LLMs) have showcased impressive reasoning capabilities, with Reinforcement Learning with Verifiable Rewards (RLVR) being a promising e…