1 paper · 1 filter
Yan Ma, Linge Du, Xuyang Shen +7
Reinforcement learning (RL) is becoming an important direction for post-training vision-language models (VLMs), but public training methodologies for unified multimodal RL remain m…