1 paper
Shenshen Li, Xing Xu, Kaiyuan Deng +3
While multi-modal large language models (MLLMs) have made significant progress in complex reasoning tasks via reinforcement learning, it is commonly believed that extensive trainin…