2 papers
cs.CV2026
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
Junxiao Xue, Quan Deng, Tingqi Hu +4
Despite recent progress in multimodal large language models (MLLMs), reliable visual question answering in aerial scenes remains challenging. In such scenes, task-critical evidence…
cs.CV2026
MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling
Xinyi Yin, Yiduo Wang, Tingqi Hu +6
Affective Image Editing (AIE) aims to modify visual content to evoke targeted emotions. Although current approaches achieve impressive editing quality, they often overlook inferenc…