978 citations · 1.3k across the 25 of their papers we have counts for
Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Reasoning-Driven Multimodal LLM for Domain Generalization
Zhipeng Xu, Zilong Wang, Xinyang Jiang +3
This paper addresses the domain generalization (DG) problem in deep learning. While most DG methods focus on enforcing visual feature invariance, we leverage the reasoning capabili…
cs.AI2026
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
Yuqi Xiong, Chunyi Peng, Zhipeng Xu +6
Visual Retrieval-Augmented Generation (VRAG) enhances Vision-Language Models (VLMs) by incorporating external visual documents to address a given query. Existing VRAG frameworks us…