2 papers
cs.CV2026
Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
Bin Chen, Yuxiang Cai, Yadan Luo +3
Reducing visual token redundancy is critical for accelerating Multimodal Large Language Models (MLLMs) without degrading cross-modal reasoning performance. Existing token pruning m…
cs.RO2025
Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
Zhizhen Zhang, Lei Zhu, Zhen Fang +2
Pre-training vision-language representations on human action videos has emerged as a promising approach to reduce reliance on large-scale expert demonstrations for training embodie…