2 papers
cs.RO2026
PACE: Phase-Progress-Aware Credit for Long-Horizon Embodied Manipulation
Chengye Song, Jiawei Zhang, Rui Song +5
Post-training of vision-language-action (VLA) models typically relies on expert demonstrations and policy interaction trajectories. However, in long-horizon manipulation, a single…
cs.CV2026
When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
Congyang Ou, Ruike Song, Yang Zhou +3
Abundant visual information strengthens vision-language model (VLM) perception, yet massive visual tokens raise inference costs. Existing visual token pruning methods rely on simil…