1 paper · 1 filter
Shuo Liu, Huixiang Cai, Weiru Zhang +1
Vision-language models excel in many multimodal tasks but remain prone to a subtle yet impactful failure mode: they tend to overestimate dominant visual-textual cues while underest…