1 paper · 1 filter
Qian Kou, Xiaofeng Shi, Yulin Li +4
Multimodal Large Language Models (MLLMs) have demonstrated significant achievements in general visual question answering (VQA) tasks. However, they remain brittle on mechanical eng…