1 paper · 1 filter
Jinyuan Li, Chengsong Huang, Langlin Huang +4
Multimodal Process Reward Models (MPRMs) are central to step-level supervision for visual reasoning in MLLMs. Training MPRMs typically requires large-scale Monte Carlo (MC)-annotat…