Showing 2026Show all
2 papers · 1 filter
cs.CV2026
AnyTrack: Unifying Visual Object Tracking with Any Modalities
Hao Li, Yunzhi Zhuge, Wenning Hao +4
Visual object tracking aims to continuously locate specific targets within sequential frames, evolving from single-modal methods to multi-modal ones. However, existing multi-modal…
cs.CV2026
ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs
Yuhao Wang, Mu Qiao, Haiwen Diao +5
Multimodal Large Language Models (MLLMs) incur prohibitive inference costs due to long visual token sequences. Training-free visual token reduction provides an efficient solution.…