2 papers
cs.RO2026
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
Yichi Zhang, Weihao Yuan, Yizhuo Zhang +2
Vision-Language-Action (VLA) models improve action generation by conditioning policies on rich vision-language information. However, current auto-regressive policies are constraine…
cs.CV2026
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
Qiangqiang Wu, Tianyu Yang, Bo Fang +4
Tracking Any Point (TAP) has emerged as a fundamental tool for video understanding. Current approaches adapt Vision Foundation Models (VFMs) like DINOv2 via offline finetuning or t…