collaborators

16 papers

cs.RO2026

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen +10

Recent advances in robot world models enable synthetic video generation for embodied prediction and planning. However, evaluating these videos is challenging: visually realistic ou…

cs.CV2026

StructSAM: Structure- and Spectrum-Preserving Token Merging for Segment Anything Models

Duy M. H. Nguyen, Tuan A. Tran, Duong Nguyen +17

Recent token merging techniques for Vision Transformers (ViTs) provide substantial speedups by reducing the number of tokens processed by self-attention, often without retraining.…

cs.RO2026

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18

Vision-Language-Action (VLA) models pre-trained on massive video-robot datasets have revolutionized robotic manipulation, yet their multi-billion parameter architectures impose pro…

cs.CV2026

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen +20

Vision-Language-Action (VLA) models enable general-purpose robotic control via large-scale multimodal pretraining, yet their effectiveness under few-shot imitation learning remains…

cs.RO2026

EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models

Thien-Loc Ha, Quang-Tan Nguyen, Trong-Bao Ho +8

Vision-Language-Action (VLA) models have emerged as a powerful paradigm for generalist robot manipulation, yet they lack geometric inductive biases: policies trained at specific or…

cs.RO2026

Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection

Trong-Bao Ho, Quang-Tan Nguyen, Thien-Loc Ha +7

Action chunking enables robot policies to produce temporally coherent behavior, but generating multi-step action sequences with flow-based policies incurs latency that is incompati…