3 papers
cs.RO2026
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18
Vision-Language-Action (VLA) models pre-trained on massive video-robot datasets have revolutionized robotic manipulation, yet their multi-billion parameter architectures impose pro…
cs.RO2026
EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models
Thien-Loc Ha, Quang-Tan Nguyen, Trong-Bao Ho +8
Vision-Language-Action (VLA) models have emerged as a powerful paradigm for generalist robot manipulation, yet they lack geometric inductive biases: policies trained at specific or…
cs.RO2026
Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection
Trong-Bao Ho, Quang-Tan Nguyen, Thien-Loc Ha +7
Action chunking enables robot policies to produce temporally coherent behavior, but generating multi-step action sequences with flow-based policies incurs latency that is incompati…