1 paper · 1 filter
Yusong Zhao, Hengyi Wang, Tanuja Ganu +2
Multimodal Large Language Models (MLLMs) have demonstrated strong performance on vision-language tasks, yet their internal visual representations remain difficult to interpret. Spa…