9 papers
RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis
Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen +10
Recent advances in robot world models enable synthetic video generation for embodied prediction and planning. However, evaluating these videos is challenging: visually realistic ou…
Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition
Tung X. Nguyen, Hieu Minh Truong, Giang Son Nguyen +3
Code-switching (CS), the alternation between multiple languages within a single utterance, remains challenging for Automatic Speech Recognition (ASR). To address this issue, we pro…
ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark
Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen +6
Code-switching (CS), which is when Vietnamese speech uses English words like drug names or procedures, is a common phenomenon in Vietnamese medical communication. This creates chal…
Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing
Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu +15
Diffusion-based Vision-Language-Action (VLA) policies enable strong generalization in robotic manipulation, but remain sensitive to spurious visual correlations and noisy action ge…
PiDA: Phonetically-Informed Data Augmentation for Robust Vietnamese Speech Translation
Giang Son Nguyen, Tung X. Nguyen, Hieu Minh Truong +3
Cascaded speech translation (ST) systems suffer from error propagation when Automatic Speech Recognition (ASR) outputs incorrect transcripts. We present the first systematic catego…
MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP
Chau Truong, Hieu Ta Quang, Dung D. Le
Vision-language models like CLIP show impressive ability to align images and text, but their training on short, concise captions makes them struggle with lengthy, detailed descript…