3 papers
cs.CL2025
Is your multimodal large language model a good science tutor?
Ming Liu, Liwen Wang, Wensheng Zhang
Multimodal large language models (MLLMs) demonstrate impressive performance on scientific reasoning tasks (e.g., ScienceQA). However, most existing benchmarks focus narrowly on the…
cs.CV2025
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
Ming Liu, Siyuan Liang, Koushik Howlader +3
Vision-Language Models (VLMs) have been integrated into autonomous driving systems to enhance reasoning capabilities through tasks such as Visual Question Answering (VQA). However,…
cs.CL2025
On Fairness of Unified Multimodal Large Language Model for Image Generation
Ming Liu, Hao Chen, Jindong Wang +3
Unified multimodal large language models (U-MLLMs) have demonstrated impressive performance in visual understanding and generation in an end-to-end pipeline. Compared with generati…