1 paper
Xia Hu, Zhenrui Yue, Brian Potetz +4
As current Multimodal Large Language Models rapidly saturate canonical visual reasoning benchmarks, a key question emerges: do these strong scores genuinely reflect robust visual u…