NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (144)

cs.CR2025

AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling

Xiaogeng Liu, Chaowei Xiao

cs.CR2026

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

Zhengyue Zhao, Yingzi Ma, Somesh Jha +3

cs.AI2023

Reinforcement Learning with Human Feedback for Realistic Traffic Simulation

Yulong Cao, Boris Ivanovic, Chaowei Xiao +1

cs.CR2024

Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges

Qin Liu, Wenjie Mo, Terry Tong +4

cs.LG2019

Performing Co-Membership Attacks Against Deep Generative Models

Kin Sum Liu, Chaowei Xiao, Bo Li +1

cs.CR2026

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

Ruoxi Sun, Jiamin Chang, Hammond Pearce +5

cs.CR2023

DeceptPrompt: Exploiting LLM-driven Code Generation via Adversarial Natural Language Instructions

Fangzhou Wu, Xiaogeng Liu, Chaowei Xiao

cs.CY2026

On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective

Yue Huang, Chujie Gao, Siyuan Wu +63

cs.CL2025

DataGen: Unified Synthetic Dataset Generation via Large Language Models

Yue Huang, Siyuan Wu, Chujie Gao +8

cs.AI2026

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang +5

cs.CR2026

AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

Ruoyao Wen, Hao Li, Chaowei Xiao +1

cs.CR2026

When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents

Yechao Zhang, Shiqian Zhao, Jiawen Zhang +5

cs.AI2023

DeepSpeed4Science Initiative: Enabling Large-Scale Scientific Discovery through Sophisticated AI System Technologies

Shuaiwen Leon Song, Bonnie Kruft, Minjia Zhang +89

cs.LG2021

Application-driven Privacy-preserving Data Publishing with Correlated Attributes

Aria Rezaei, Chaowei Xiao, Jie Gao +2

cs.CR2024

JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks

Weidi Luo, Siyuan Ma, Xiaogeng Liu +2

cs.LG2021

Robust Deep Reinforcement Learning against Adversarial Perturbations on State Observations

Huan Zhang, Hongge Chen, Chaowei Xiao +4

cs.CR2026

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu +3

cs.CL2023

Shall We Pretrain Autoregressive Language Models with Retrieval? A Comprehensive Study

Boxin Wang, Wei Ping, Peng Xu +9

cs.CV2024

MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding

Fei Wang, Xingyu Fu, James Y. Huang +18

cs.CL2023

Defending against Insertion-based Textual Backdoor Attacks via Attribution

Jiazhao Li, Zhuofeng Wu, Wei Ping +2

cs.CL2024

TrustLLM: Trustworthiness in Large Language Models

Yue Huang, Lichao Sun, Haoran Wang +67

cs.CR2023

On the Exploitability of Instruction Tuning

Manli Shu, Jiongxiao Wang, Chen Zhu +3

cs.LG2022

SecretGen: Privacy Recovery on Pre-Trained Models via Distribution Discrimination

Zhuowen Yuan, Fan Wu, Yunhui Long +2

cs.CV2022

Understanding The Robustness in Vision Transformers

Daquan Zhou, Zhiding Yu, Enze Xie +4

cs.CR2024

WIPI: A New Web Threat for LLM-Driven Web Agents

Fangzhou Wu, Shutong Wu, Yulong Cao +1

cs.CR2026

Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures

Bowen Sun, Chaowei Xiao

cs.SD2023

Defending against Adversarial Audio via Diffusion Model

Shutong Wu, Jiongxiao Wang, Wei Ping +2

cs.CL2024

Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models

Jiashu Xu, Mingyu Derek Ma, Fei Wang +2

cs.CL2024

Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking

Nan Xu, Fei Wang, Ben Zhou +3

cs.DB2025

Declarative Privacy-Preserving Inference Queries

Hong Guan, Ansh Tiwari, Summer Gautier +8

cs.CR2024

System-Level Defense against Indirect Prompt Injection Attacks: An Information Flow Control Perspective

Fangzhou Wu, Ethan Cecchetti, Chaowei Xiao

cs.AI2023

Voyager: An Open-Ended Embodied Agent with Large Language Models

Guanzhi Wang, Yuqi Xie, Yunfan Jiang +5

cs.CR2018

Spatially Transformed Adversarial Examples

Chaowei Xiao, Jun-Yan Zhu, Bo Li +3

cs.CR2025

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

Xiaogeng Liu, Peiran Li, Edward Suh +7

cs.LG2024

PerAda: Parameter-Efficient Federated Learning Personalization with Generalization Guarantees

Chulin Xie, De-An Huang, Wenda Chu +4

cs.CV2024

Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness

Yiquan Li, Zhongzhu Chen, Kun Jin +3

cs.CR2023

Detecting Backdoors During the Inference Stage Based on Corruption Robustness Consistency

Xiaogeng Liu, Minghui Li, Haoyu Wang +5

cs.CR2026

Defenses Against Prompt Attacks Learn Surface Heuristics

Shawn Li, Chenxiao Yu, Zhiyu Ni +4

cs.CR2023

ChatGPT as an Attack Tool: Stealthy Textual Backdoor Attack via Blackbox Generative Model Trigger

Jiazhao Li, Yijin Yang, Zhuofeng Wu +2

cs.LG2019

Towards Stable and Efficient Training of Verifiably Robust Neural Networks

Huan Zhang, Hongge Chen, Chaowei Xiao +5

cs.CR2026

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

Xiao Li, Xiang Zheng, Yifeng Gao +35

cs.LG2022

AdvDO: Realistic Adversarial Attacks for Trajectory Prediction

Yulong Cao, Chaowei Xiao, Anima Anandkumar +2

cs.CR2018

Characterizing Adversarial Examples Based on Spatial Consistency Information for Semantic Segmentation

Chaowei Xiao, Ruizhi Deng, Bo Li +3

cs.CL2024

From Shortcuts to Triggers: Backdoor Defense with Denoised PoE

Qin Liu, Fei Wang, Chaowei Xiao +1

cs.LG2026

ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention

Xinyan Wang, Xiaogeng Liu, Chaowei Xiao

cs.CV2025

SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability

Peiyang Xu, Minzhou Pan, Zhaorun Chen +3

cs.CR2025

EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage

Zeyi Liao, Lingbo Mo, Chejian Xu +6

cs.LG2024

AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases

Zhaorun Chen, Zhen Xiang, Chaowei Xiao +2

cs.CR2024

RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process

Peiran Wang, Xiaogeng Liu, Chaowei Xiao

cs.CR2026

ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models

Xiaogeng Liu, Xinyan Wang, Yechao Zhang +5

cs.LG2020

SemanticAdv: Generating Adversarial Examples via Attribute-conditional Image Editing

Haonan Qiu, Chaowei Xiao, Lei Yang +3

cs.CV2026

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

Yingzi Ma, Chaowei Xiao, Ming Jiang

cs.LG2026

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

Yingzi Ma, Zichen Zhu, Ming Jiang +1

cs.CV2024

Leveraging Hierarchical Feature Sharing for Efficient Dataset Condensation

Haizhong Zheng, Jiachen Sun, Shutong Wu +4

cs.CV2024

IDNet: A Novel Dataset for Identity Document Analysis and Fraud Detection

Hong Guan, Yancheng Wang, Lulu Xie +8

cs.CR2019

Adversarial Sensor Attack on LiDAR-based Perception in Autonomous Driving

Yulong Cao, Chaowei Xiao, Benjamin Cyr +6

cs.LG2023

Mole Recruitment: Poisoning of Image Classifiers via Selective Batch Sampling

Ethan Wisdom, Tejas Gokhale, Chaowei Xiao +1

cs.CV2023

Dolphins: Multimodal Language Model for Driving

Yingzi Ma, Yulong Cao, Jiachen Sun +2

cs.CV2022

RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning

Xiaojian Ma, Weili Nie, Zhiding Yu +5

cs.LG2022

Benchmarking Robustness of 3D Point Cloud Recognition Against Common Corruptions

Jiachen Sun, Qingzhao Zhang, Bhavya Kailkhura +3

cs.CR2019

MeshAdv: Adversarial Meshes for Visual Recognition

Chaowei Xiao, Dawei Yang, Bo Li +2

cs.CR2019

Improving Robustness of ML Classifiers against Realizable Evasion Attacks Using Conserved Features

Liang Tong, Bo Li, Chen Hajaj +3

cs.LG2021

Auditing AI models for Verified Deployment under Semantic Specifications

Homanga Bharadhwaj, De-An Huang, Chaowei Xiao +2

cs.AI2025

AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection

Weidi Luo, Shenghong Dai, Xiaogeng Liu +4

cs.CV2023

Differentially Private Video Activity Recognition

Zelun Luo, Yuliang Zou, Yijin Yang +6

cs.CL2026

Can Editing LLMs Inject Harm?

Canyu Chen, Baixiang Huang, Zekun Li +12

cs.CR2026

Runtime Skill Audit: Targeted Runtime Probing for Agent Skill Security

Tu Lan, Chaowei Xiao

cs.CR2024

FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks

Jiongxiao Wang, Fangzhou Wu, Wendi Li +5

cs.AI2025

MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines

Yaolun Zhang, Xiaogeng Liu, Chaowei Xiao

cs.CR2026

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

Hao Li, Xiaogeng Liu, Hung-Chun Chiu +3

cs.CR2026

Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks

Chong Xiang, Drew Zagieboylo, Shaona Ghosh +5

cs.CV2025

dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

Yingzi Ma, Yulong Cao, Wenhao Ding +6

cs.CR2025

Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis

Mintong Kang, Chong Xiang, Sanjay Kariyappa +3

cs.CV2025

Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset

Yingzi Ma, Jiongxiao Wang, Fei Wang +10

cs.CR2026

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

Nanxi Li, Zhengyue Zhao, G. Edward Suh +2

cs.CV2022

PointDP: Diffusion-driven Purification against Adversarial Attacks on 3D Point Cloud Recognition

Jiachen Sun, Weili Nie, Zhiding Yu +2

cs.LG2022

Diffusion Models for Adversarial Purification

Weili Nie, Brandon Guo, Yujia Huang +3

cs.CR2026

Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution

Yechao Zhang, Shiqian Zhao, Jie Zhang +5

cs.CR2019

Generating Adversarial Examples with Adversarial Networks

Chaowei Xiao, Bo Li, Jun-Yan Zhu +3

cs.CV2023

Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning

Zhuolin Yang, Wei Ping, Zihan Liu +13

cs.CR2024

Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment

Jiongxiao Wang, Jiazhao Li, Yiquan Li +7

cs.LG2022

DensePure: Understanding Diffusion Models towards Adversarial Robustness

Chaowei Xiao, Zhongzhu Chen, Kun Jin +6

cs.CV2022

Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models

Manli Shu, Weili Nie, De-An Huang +4

cs.CR2026

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

Bowen Sun, Chaozhuo Li, Yaodong Yang +2

cs.CV2026

Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification

Yuhao Sun, Jiacheng Zhang, Zesheng Ye +2

cs.CR2025

OET: Optimization-based prompt injection Evaluation Toolkit

Jinsheng Pan, Xiaogeng Liu, Chaowei Xiao

cs.CR2026

Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models

Weidi Luo, Tianyu Lu, Qiming Zhang +8

cs.LG2023

DiffSmooth: Certifiably Robust Learning via Diffusion Models and Local Smoothing

Jiawei Zhang, Zhongzhu Chen, Huan Zhang +2

cs.CR2026

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails

Nanxi Li, Zhengyue Zhao, Chaowei Xiao

cs.CR2023

Exploring the Limits of ChatGPT in Software Security Applications

Fangzhou Wu, Qingzhao Zhang, Ati Priya Bajaj +4

cs.LG2018

Data Poisoning Attack against Unsupervised Node Embedding Methods

Mingjie Sun, Jian Tang, Huichen Li +4

cs.LG2025

LeanAgent: Lifelong Learning for Formal Theorem Proving

Adarsh Kumarappan, Mo Tiwari, Peiyang Song +3

cs.CV2024

T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching

Zizheng Pan, Bohan Zhuang, De-An Huang +5

cs.CV2023

VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion

Yiming Li, Zhiding Yu, Christopher Choy +5

cs.CV2023

CSI: Enhancing the Robustness of 3D Point Cloud Recognition against Corruption

Zhuoyuan Wu, Jiachen Sun, Chaowei Xiao

cs.LG2026

When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

Xiaogeng Liu, Xinyan Wang, Yingzi Ma +2

cs.CR2025

JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model

Yi Nian, Shenzhe Zhu, Yuehan Qin +4

cs.CR2026

AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents

Xinhang Ma, Taoran Li, Chaowei Xiao +3

cs.LG2024

Preference Poisoning Attacks on Reward Model Learning

Junlin Wu, Jiongxiao Wang, Chaowei Xiao +3

q-bio.QM2023

Retrieval-based Controllable Molecule Generation

Zichao Wang, Weili Nie, Zhuoran Qiao +3