1 paper · 1 filter
Feng Xiong, Leyan Xue, Hongyu Lin
On-policy distillation provides dense supervision for multimodal reasoners, but its trajectory-level reward cannot determine whether a failed answer arose from perception or subseq…