4 papers
CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning
Junru Song, Wenhao Zhang, Yang Yang +7
Target-oriented vision-and-language navigation (VLN) on aerial platforms is attracting growing attention for missions such as disaster rescue, infrastructure inspection, and securi…
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
Junru Song, Yimeng Hu, Yijing Chen +4
Large Vision-Language Models (VLMs) have achieved remarkable multimodal performance yet remain prone to factual hallucinations, particularly in long-tail or specialized domains. Mo…
-Reader: Dual Evolving Graphs for Multimodal Document QA
Yaxin Du, Junru Song, Yifan Zhou +8
Retrieval-augmented generation is a practical paradigm for question answering over long documents, but it remains brittle for multimodal reading where text, tables, and figures are…
Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration
Shao Zhang, Xihuai Wang, Wenhao Zhang +10
Agents built on large language models (LLMs) have excelled in turn-by-turn human-AI collaboration but struggle with simultaneous tasks requiring real-time interaction. Latency issu…