1 paper
Jingze Wu, Quan Zhang, Hongfei Suo +2
Although reinforcement learning (RL) has significantly advanced reasoning capabilities in large multimodal language models (MLLMs), its efficacy remains limited for lightweight mod…