3 papers
cs.CV2026
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
Fengbin Zhu, Zijing Cai, Yuzhe Wang +5
Visual Document Retrieval (VDR) requires representations that capture both fine-grained visual details and global document structure to ensure retrieval efficacy while maintaining…
cs.CV2025
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
Liangtao Shi, Ting Liu, Xiantao Hu +3
Visual grounding aims to ground an image region through natural language, which heavily relies on cross-modal alignment. Most existing methods transfer visual/linguistic knowledge…
cs.CV2024
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
Ting Liu, Liangtao Shi, Richang Hong +3
The vision tokens in multimodal large language models usually exhibit significant spatial and temporal redundancy and take up most of the input tokens, which harms their inference…