3 papers
cs.RO2026
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
Baoshun Tong, Haoran He, Ling Pan +2
Vision-Language-Action (VLA) models have achieved remarkable success in robotic manipulation. However, their robustness to linguistic nuances remains a critical, under-explored saf…
cs.CV2024
Enhancing Few-Shot Out-of-Distribution Detection with Gradient Aligned Context Optimization
Baoshun Tong, Kaiyu Song, Hanjiang Lai
Few-shot out-of-distribution (OOD) detection aims to detect OOD images from unseen classes with only a few labeled in-distribution (ID) images. To detect OOD images and classify ID…
cs.CV2024
Test-time Alignment-Enhanced Adapter for Vision-Language Models
Baoshun Tong, Kaiyu Song, Hanjiang Lai
Test-time adaptation with pre-trained vision-language models (VLMs) has attracted increasing attention for tackling the issue of distribution shift during the test phase. While pri…