1 paper · 1 filter
Wenbo Hu, Xin Chen, Yan Gao-Tian +3
Group Relative Policy Optimization (GRPO) has emerged as the de facto Reinforcement Learning (RL) objective driving recent advancements in Multimodal Large Language Models. However…