1 paper
Jisheng Dang, Jingze Wu, Teng Wang +6
Recent advancements in reinforcement learning, particularly through Group Relative Policy Optimization (GRPO), have significantly improved multimodal large language models for comp…