Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias
Xingming Li, Ao Cheng, Qiyao Sun +4
When vision contradicts text, multimodal large language models (MLLMs) consistently favor text, even when images provide clear evidence otherwise. This bias poses risks for applica…
cs.CV2026
StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning
Xixiang He, Baiqi Wu, Xingming Li +4
Multimodal large language models (MLLMs) often know the rule but pick the wrong answer: on abstract visual reasoning (AVR) tasks, a model can describe what it sees and name the und…
cs.CV2026
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
Ao Cheng, Xingming Li, Xuanyu Ji +5
Electronic Navigational Charts (ENCs) are the safety-critical backbone of modern maritime navigation, yet it remains unclear whether multimodal large language models (MLLMs) can re…