1 paper · 1 filter
Shujian Gao, Yuan Wang, Jiangtao Yan +2
Reinforcement Learning with Verifiable Rewards (RLVR) has significantly advanced reasoning capabilities in Large Language Models. However, adapting RLVR to multimodal domains suffe…