1 paper
Hyunwoong Kim, Seongeun Lee, Hannah Yun +2
Group Relative Policy Optimization (GRPO) and its variants, originally developed for Large Language Models (LLMs), have recently been applied to Multimodal LLMs and produced strong…