1 paper
Qian Kou, Xiaofeng Shi, Yulin Li +4
Multimodal Large Language Models (MLLMs) have demonstrated significant achievements in general visual question answering (VQA) tasks. However, they remain brittle on mechanical eng…