1 paper
Shuo Liu, Huixiang Cai, Weiru Zhang +1
Vision-language models excel in many multimodal tasks but remain prone to a subtle yet impactful failure mode: they tend to overestimate dominant visual-textual cues while underest…