Showing cs.ROShow all
3 papers · 1 filter
cs.RO2026
RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis
Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen +10
Recent advances in robot world models enable synthetic video generation for embodied prediction and planning. However, evaluating these videos is challenging: visually realistic ou…
cs.RO2026
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18
Vision-Language-Action (VLA) models pre-trained on massive video-robot datasets have revolutionized robotic manipulation, yet their multi-billion parameter architectures impose pro…
cs.RO2026
Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing
Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu +15
Diffusion-based Vision-Language-Action (VLA) policies enable strong generalization in robotic manipulation, but remain sensitive to spurious visual correlations and noisy action ge…