collaborators

9 papers

cs.RO2026

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen +10

Recent advances in robot world models enable synthetic video generation for embodied prediction and planning. However, evaluating these videos is challenging: visually realistic ou…

cs.CL2026

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

Tung X. Nguyen, Hieu Minh Truong, Giang Son Nguyen +3

Code-switching (CS), the alternation between multiple languages within a single utterance, remains challenging for Automatic Speech Recognition (ASR). To address this issue, we pro…

cs.CL2026

ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen +6

Code-switching (CS), which is when Vietnamese speech uses English words like drug names or procedures, is a common phenomenon in Vietnamese medical communication. This creates chal…

cs.RO2026

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu +15

Diffusion-based Vision-Language-Action (VLA) policies enable strong generalization in robotic manipulation, but remain sensitive to spurious visual correlations and noisy action ge…

cs.CL2026

PiDA: Phonetically-Informed Data Augmentation for Robust Vietnamese Speech Translation

Giang Son Nguyen, Tung X. Nguyen, Hieu Minh Truong +3

Cascaded speech translation (ST) systems suffer from error propagation when Automatic Speech Recognition (ASR) outputs incorrect transcripts. We present the first systematic catego…

cs.CV2025

MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP

Chau Truong, Hieu Ta Quang, Dung D. Le

Vision-language models like CLIP show impressive ability to align images and text, but their training on short, concise captions makes them struggle with lengthy, detailed descript…