1 paper · 1 filter
Yang Yu, Zhuangzhuang Chen, Lanqing Li +1
Recently, reinforcement learning (RL) has become a common choice in enhancing the reasoning capabilities of vision-language models (VLMs). Considering existing RL-based finetuning…