8 papers
NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
Junjie An, Yi Wu, Xiao Liu +5
NavCMPO is a two-stage framework for mapless visual navigation that combines few-step diffusion trajectory generation, critic‑guided refinement, and PPO fine‑tuning to improve succ…
SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
Yi Wu, Junjie An, Xiao Liu +6
SoftNav introduces a method to embed continuous 3D object representations as soft tokens directly into a frozen vision‑language model, enabling efficient embodied navigation with m…
Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models
Xiao Liu, Jiaxiang Liu, Boci Peng +6
Vision Language Models adapt well to downstream tasks but are highly vulnerable to adversarial perturbations that disrupt cross-modal semantic alignment. Existing defenses are larg…
Accelerating Rectified Flow Models via Trajectory-Aware Caching
Xiao Liu, Kai Liu, Naiyang Guan +5
Diffusion and rectified flow (RF) models generate high-fidelity images and videos, but their iterative velocity-field evaluations are computationally expensive. Existing caching me…
Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models
Jiaxiang Liu, Jiawei Du, Xiao Liu +2
Pre-trained vision-language models (VLMs) such as CLIP have demonstrated strong zero-shot capabilities across diverse domains, yet remain highly vulnerable to adversarial perturbat…
Towards Adaptive Meta-Gradient Adversarial Examples for Visual Tracking
Wei-Long Tian, Peng Gao, Xiao Liu +4
In recent years, visual tracking methods based on convolutional neural networks and Transformers have achieved remarkable performance and have been successfully applied in fields s…