1 paper
Yi Liu, Jing Zhang, Di Wang +3
Multimodal large language models (MLLMs) suffer from pronounced hallucinations in remote sensing visual question-answering (RS-VQA), primarily caused by visual grounding failures i…