1 paper · 1 filter
Shuyao Xiao, Shengling Wang, Haoyu Niu +4
Vision-language models (VLMs) are increasingly evaluated on complex image and video understanding tasks, yet conventional metrics primarily assess final-answer quality and reveal l…