1 paper
Haoxiang Sun, Lizhen Xu, Bing Zhao +5
Reinforcement Learning with Verifiable Rewards (RLVR) has been shown effective in enhancing the visual reflection and reasoning capabilities of Large Multimodal Models (LMMs). Howe…