2 papers
cs.RO2026
A Pragmatic VLA Foundation Model
Wei Wu, Fan Lu, Yunnan Wang +22
Offering great potential in robotic manipulation, a capable Vision-Language-Action (VLA) foundation model is expected to faithfully generalize across tasks and platforms while ensu…
cs.CV2026
Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning
Yuqiao Zeng, Xu Wang, Tengfei Liang +3
Multimodal learning integrates complementary information from different modalities such as image, text, and audio to improve model performance, but its success relies on large-scal…