2 papers
cs.CV2026
ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models
Dhruv Parikh, Haoyang Fan, Rajgopal Kannan +1
Vision-Language Models (VLMs) are expensive because the LLM processes hundreds of largely redundant visual tokens. Existing token reduction methods typically exploit \textit{either…
cs.IR2026
SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation
Yuxin Yang, Gangda Deng, Ömer Faruk Akgül +6
Retrieval-Augmented Generation (RAG) grounds large language model outputs in external evidence, but remains challenged on multi-hop question answering that requires long reasoning.…