1 paper
Mingyuan Wu, Jingcheng Yang, Shengyi Qian +11
We introduce Self-Verified Reasoner (SVR-R1), a multi-turn RL framework that turns a model's own verification into a learning signal for multimodal reasoning. For each query, the m…