1 paper · 1 filter
Tianze Yang, Yucheng Shi, Ruitong Sun +3
Reinforcement learning (RL) for visual reasoning needs scalable, verifiable, and controllable training signals. Existing visual RL post-training trains on static curated datasets,…