3 papers
cs.CV2026
Co-Me: Confidence-Guided Token Merging for Visual Geometric Transformers
Yutian Chen, Yuheng Qiu, Ruogu Li +4
We propose Confidence-Guided Token Merging (Co-Me), an acceleration mechanism for visual geometric transformers without retraining or finetuning the base model. Co-Me distilled a l…
cs.RO2025
Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered
Jason Jabbour, Dong-Ki Kim, Max Smith +6
Vision-Language-Action (VLA) models have advanced robotic capabilities but remain challenging to deploy on resource-limited hardware. Pruning has enabled efficient compression of l…
cs.RO2025
VENTURA: Adapting Image Diffusion Models for Unified Task Conditioned Navigation
Arthur Zhang, Xiangyun Meng, Luca Calliari +5
Robots must adapt to diverse human instructions and operate safely in unstructured, open-world environments. Recent Vision-Language models (VLMs) offer strong priors for grounding…