papers

Publications (5)

cs.CL2026

-Reader: Dual Evolving Graphs for Multimodal Document QA

Yaxin Du, Junru Song, Yifan Zhou +8

Retrieval-augmented generation is a practical paradigm for question answering over long documents, but it remains brittle for multimodal reading where text, tables, and figures are…

cs.RO2024

HeteroMorpheus: Universal Control Based on Morphological Heterogeneity Modeling

YiFan Hao, Yang Yang, Junru Song +4

In the field of robotic control, designing individual controllers for each robot leads to high computational costs. Universal control policies, applicable across diverse robot morp…

cs.AI2025

Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration

Shao Zhang, Xihuai Wang, Wenhao Zhang +10

Agents built on large language models (LLMs) have excelled in turn-by-turn human-AI collaboration but struggle with simultaneous tasks requiring real-time interaction. Latency issu…

cs.AI2026

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

Junru Song, Wenhao Zhang, Yang Yang +7

Target-oriented vision-and-language navigation (VLN) on aerial platforms is attracting growing attention for missions such as disaster rescue, infrastructure inspection, and securi…

cs.CV2026

Delineating Knowledge Boundaries for Honest Large Vision-Language Models

Junru Song, Yimeng Hu, Yijing Chen +4

Large Vision-Language Models (VLMs) have achieved remarkable multimodal performance yet remain prone to factual hallucinations, particularly in long-tail or specialized domains. Mo…