1 paper · 1 filter
Xirui Li, Ming Li, Tianyi Zhou
Reinforcement learning (RL) with verifiable rewards has become a standard post-training stage for boosting visual reasoning in vision-language models, yet it remains unclear what c…