1 paper · 1 filter
Kun Chen, Peng Shi, Haibo Qiu +4
Reinforcement learning (RL) with verifiable rewards has recently catalyzed a wave of "MLLM-r1" approaches that bring RL to vision language models. Most representative paradigms beg…