Publications (144)
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
Xiaogeng Liu, Chaowei Xiao
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
Zhengyue Zhao, Yingzi Ma, Somesh Jha +3
Reinforcement Learning with Human Feedback for Realistic Traffic Simulation
Yulong Cao, Boris Ivanovic, Chaowei Xiao +1
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
Qin Liu, Wenjie Mo, Terry Tong +4
Performing Co-Membership Attacks Against Deep Generative Models
Kin Sum Liu, Chaowei Xiao, Bo Li +1
SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats
Ruoxi Sun, Jiamin Chang, Hammond Pearce +5
DeceptPrompt: Exploiting LLM-driven Code Generation via Adversarial Natural Language Instructions
Fangzhou Wu, Xiaogeng Liu, Chaowei Xiao
On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective
Yue Huang, Chujie Gao, Siyuan Wu +63
DataGen: Unified Synthetic Dataset Generation via Large Language Models
Yue Huang, Siyuan Wu, Chujie Gao +8
ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems
Zhuowen Yuan, Zhaorun Chen, Zhen Xiang +5
AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management
Ruoyao Wen, Hao Li, Chaowei Xiao +1
When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
Yechao Zhang, Shiqian Zhao, Jiawen Zhang +5
DeepSpeed4Science Initiative: Enabling Large-Scale Scientific Discovery through Sophisticated AI System Technologies
Shuaiwen Leon Song, Bonnie Kruft, Minjia Zhang +89
Application-driven Privacy-preserving Data Publishing with Correlated Attributes
Aria Rezaei, Chaowei Xiao, Jie Gao +2
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
Weidi Luo, Siyuan Ma, Xiaogeng Liu +2
Robust Deep Reinforcement Learning against Adversarial Perturbations on State Observations
Huan Zhang, Hongge Chen, Chaowei Xiao +4
MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models
Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu +3
Shall We Pretrain Autoregressive Language Models with Retrieval? A Comprehensive Study
Boxin Wang, Wei Ping, Peng Xu +9
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
Fei Wang, Xingyu Fu, James Y. Huang +18
Defending against Insertion-based Textual Backdoor Attacks via Attribution
Jiazhao Li, Zhuofeng Wu, Wei Ping +2
TrustLLM: Trustworthiness in Large Language Models
Yue Huang, Lichao Sun, Haoran Wang +67
On the Exploitability of Instruction Tuning
Manli Shu, Jiongxiao Wang, Chen Zhu +3
SecretGen: Privacy Recovery on Pre-Trained Models via Distribution Discrimination
Zhuowen Yuan, Fan Wu, Yunhui Long +2
Understanding The Robustness in Vision Transformers
Daquan Zhou, Zhiding Yu, Enze Xie +4
WIPI: A New Web Threat for LLM-Driven Web Agents
Fangzhou Wu, Shutong Wu, Yulong Cao +1
Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures
Bowen Sun, Chaowei Xiao
Defending against Adversarial Audio via Diffusion Model
Shutong Wu, Jiongxiao Wang, Wei Ping +2
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
Jiashu Xu, Mingyu Derek Ma, Fei Wang +2
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
Nan Xu, Fei Wang, Ben Zhou +3
Declarative Privacy-Preserving Inference Queries
Hong Guan, Ansh Tiwari, Summer Gautier +8
System-Level Defense against Indirect Prompt Injection Attacks: An Information Flow Control Perspective
Fangzhou Wu, Ethan Cecchetti, Chaowei Xiao
Voyager: An Open-Ended Embodied Agent with Large Language Models
Guanzhi Wang, Yuqi Xie, Yunfan Jiang +5
Spatially Transformed Adversarial Examples
Chaowei Xiao, Jun-Yan Zhu, Bo Li +3
AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
Xiaogeng Liu, Peiran Li, Edward Suh +7
PerAda: Parameter-Efficient Federated Learning Personalization with Generalization Guarantees
Chulin Xie, De-An Huang, Wenda Chu +4
Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
Yiquan Li, Zhongzhu Chen, Kun Jin +3
Detecting Backdoors During the Inference Stage Based on Corruption Robustness Consistency
Xiaogeng Liu, Minghui Li, Haoyu Wang +5
Defenses Against Prompt Attacks Learn Surface Heuristics
Shawn Li, Chenxiao Yu, Zhiyu Ni +4
ChatGPT as an Attack Tool: Stealthy Textual Backdoor Attack via Blackbox Generative Model Trigger
Jiazhao Li, Yijin Yang, Zhuofeng Wu +2
Towards Stable and Efficient Training of Verifiably Robust Neural Networks
Huan Zhang, Hongge Chen, Chaowei Xiao +5
Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
Xiao Li, Xiang Zheng, Yifeng Gao +35
AdvDO: Realistic Adversarial Attacks for Trajectory Prediction
Yulong Cao, Chaowei Xiao, Anima Anandkumar +2
Characterizing Adversarial Examples Based on Spatial Consistency Information for Semantic Segmentation
Chaowei Xiao, Ruizhi Deng, Bo Li +3
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
Qin Liu, Fei Wang, Chaowei Xiao +1
ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention
Xinyan Wang, Xiaogeng Liu, Chaowei Xiao
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
Peiyang Xu, Minzhou Pan, Zhaorun Chen +3
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
Zeyi Liao, Lingbo Mo, Chejian Xu +6
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
Zhaorun Chen, Zhen Xiang, Chaowei Xiao +2
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
Peiran Wang, Xiaogeng Liu, Chaowei Xiao
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
Xiaogeng Liu, Xinyan Wang, Yechao Zhang +5
SemanticAdv: Generating Adversarial Examples via Attribute-conditional Image Editing
Haonan Qiu, Chaowei Xiao, Lei Yang +3
GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving
Yingzi Ma, Chaowei Xiao, Ming Jiang
One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context
Yingzi Ma, Zichen Zhu, Ming Jiang +1
Leveraging Hierarchical Feature Sharing for Efficient Dataset Condensation
Haizhong Zheng, Jiachen Sun, Shutong Wu +4
IDNet: A Novel Dataset for Identity Document Analysis and Fraud Detection
Hong Guan, Yancheng Wang, Lulu Xie +8
Adversarial Sensor Attack on LiDAR-based Perception in Autonomous Driving
Yulong Cao, Chaowei Xiao, Benjamin Cyr +6
Mole Recruitment: Poisoning of Image Classifiers via Selective Batch Sampling
Ethan Wisdom, Tejas Gokhale, Chaowei Xiao +1
Dolphins: Multimodal Language Model for Driving
Yingzi Ma, Yulong Cao, Jiachen Sun +2
RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning
Xiaojian Ma, Weili Nie, Zhiding Yu +5
Benchmarking Robustness of 3D Point Cloud Recognition Against Common Corruptions
Jiachen Sun, Qingzhao Zhang, Bhavya Kailkhura +3
MeshAdv: Adversarial Meshes for Visual Recognition
Chaowei Xiao, Dawei Yang, Bo Li +2
Improving Robustness of ML Classifiers against Realizable Evasion Attacks Using Conserved Features
Liang Tong, Bo Li, Chen Hajaj +3
Auditing AI models for Verified Deployment under Semantic Specifications
Homanga Bharadhwaj, De-An Huang, Chaowei Xiao +2
AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection
Weidi Luo, Shenghong Dai, Xiaogeng Liu +4
Differentially Private Video Activity Recognition
Zelun Luo, Yuliang Zou, Yijin Yang +6
Can Editing LLMs Inject Harm?
Canyu Chen, Baixiang Huang, Zekun Li +12
Runtime Skill Audit: Targeted Runtime Probing for Agent Skill Security
Tu Lan, Chaowei Xiao
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
Jiongxiao Wang, Fangzhou Wu, Wendi Li +5
MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
Yaolun Zhang, Xiaogeng Liu, Chaowei Xiao
DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
Hao Li, Xiaogeng Liu, Hung-Chun Chiu +3
Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks
Chong Xiang, Drew Zagieboylo, Shaona Ghosh +5
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
Yingzi Ma, Yulong Cao, Wenhao Ding +6
Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
Mintong Kang, Chong Xiang, Sanjay Kariyappa +3
Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
Yingzi Ma, Jiongxiao Wang, Fei Wang +10
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
Nanxi Li, Zhengyue Zhao, G. Edward Suh +2
PointDP: Diffusion-driven Purification against Adversarial Attacks on 3D Point Cloud Recognition
Jiachen Sun, Weili Nie, Zhiding Yu +2
Diffusion Models for Adversarial Purification
Weili Nie, Brandon Guo, Yujia Huang +3
Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution
Yechao Zhang, Shiqian Zhao, Jie Zhang +5
Generating Adversarial Examples with Adversarial Networks
Chaowei Xiao, Bo Li, Jun-Yan Zhu +3
Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning
Zhuolin Yang, Wei Ping, Zihan Liu +13
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
Jiongxiao Wang, Jiazhao Li, Yiquan Li +7
DensePure: Understanding Diffusion Models towards Adversarial Robustness
Chaowei Xiao, Zhongzhu Chen, Kun Jin +6
Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models
Manli Shu, Weili Nie, De-An Huang +4
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
Bowen Sun, Chaozhuo Li, Yaodong Yang +2
Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification
Yuhao Sun, Jiacheng Zhang, Zesheng Ye +2
OET: Optimization-based prompt injection Evaluation Toolkit
Jinsheng Pan, Xiaogeng Liu, Chaowei Xiao
Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models
Weidi Luo, Tianyu Lu, Qiming Zhang +8
DiffSmooth: Certifiably Robust Learning via Diffusion Models and Local Smoothing
Jiawei Zhang, Zhongzhu Chen, Huan Zhang +2
LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails
Nanxi Li, Zhengyue Zhao, Chaowei Xiao
Exploring the Limits of ChatGPT in Software Security Applications
Fangzhou Wu, Qingzhao Zhang, Ati Priya Bajaj +4
Data Poisoning Attack against Unsupervised Node Embedding Methods
Mingjie Sun, Jian Tang, Huichen Li +4
LeanAgent: Lifelong Learning for Formal Theorem Proving
Adarsh Kumarappan, Mo Tiwari, Peiyang Song +3
T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching
Zizheng Pan, Bohan Zhuang, De-An Huang +5
VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion
Yiming Li, Zhiding Yu, Christopher Choy +5
CSI: Enhancing the Robustness of 3D Point Cloud Recognition against Corruption
Zhuoyuan Wu, Jiachen Sun, Chaowei Xiao
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
Xiaogeng Liu, Xinyan Wang, Yingzi Ma +2
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
Yi Nian, Shenzhe Zhu, Yuehan Qin +4
AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents
Xinhang Ma, Taoran Li, Chaowei Xiao +3
Preference Poisoning Attacks on Reward Model Learning
Junlin Wu, Jiongxiao Wang, Chaowei Xiao +3
Retrieval-based Controllable Molecule Generation
Zichao Wang, Weili Nie, Zhuoran Qiao +3