2 papers
cs.RO2026
Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models
Dongdong An, Pengjie Zhao, Yihao Huang +5
Recent Vision-Language-Action (VLA) models achieve promising performance in robotic manipulation, typically measured by success rates aggregated over predefined object configuratio…
cs.CV2025
Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models
Fan Yang, Yihao Huang, Jiayi Zhu +4
Diffusion-based text-to-image (T2I) models enable high-quality image generation but also pose significant risks of misuse, particularly in producing not-safe-for-work (NSFW) conten…