2 papers
cs.CV2026
Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs
Jiasheng Li, Zhong Ji, Yan Zhang +1
Large Vision-Language Models (VLMs) suffer from prohibitive inference overhead due to long sequences of visual tokens. However, existing visual token reduction methods mainly impro…
cs.CV2026
TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering
Zhong Ji, Keqi Jin, Yan Zhang +1
Long-document multimodal question answering requires more than retrieving relevant chunks from a large document. Different queries require different evidence behavior. Existing mul…