papers

Publications (44)

cs.LG2025

Boosting Jailbreak Attack with Momentum

Yihao Zhang, Zeming Wei

cs.LG2026

Unveiling the Basin-Like Loss Landscape in Large Language Models

Huanran Chen, Yinpeng Dong, Zeming Wei +4

cs.SE2024

MILE: A Mutation Testing Framework of In-Context Learning Systems

Zeming Wei, Yihao Zhang, Meng Sun

cs.CL2023

Weighted Automata Extraction and Explanation of Recurrent Neural Networks for Natural Language Tasks

Zeming Wei, Xiyue Zhang, Yihao Zhang +1

cs.LG2025

Identifying and Understanding Cross-Class Features in Adversarial Training

Zeming Wei, Yiwen Guo, Yisen Wang

cs.CL2025

Automata-Based Steering of Large Language Models for Diverse Structured Generation

Xiaokun Luan, Zeming Wei, Yihao Zhang +1

cs.CL2026

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

Tianqi Du, Lizhe Fang, Weijie Yang +4

cs.LG2026

RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning

Zeming Wei, Qiaosheng Zhang, Xia Hu +1

cs.LG2025

Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings

Zhixin Zhang, Zeming Wei, Meng Sun

cs.SE2026

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing

Zeming Wei, Zhixin Zhang, Chengcan Wu +3

cs.LG2025

Towards the Worst-case Robustness of Large Language Models

Huanran Chen, Yinpeng Dong, Zeming Wei +2

cs.CR2026

Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation

Chengcan Wu, Zhixin Zhang, Mingqian Xu +2

cs.LG2025

Stabilizing Multi-Attack Adversarial Training via Bandit Optimization

Rui Wang, Zeming Wei, Xiyue Zhang +1

cs.CR2026

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

Yihao Zhang, Kai Wang, Jiangrong Wu +7

cs.LG2023

Architecture Matters: Uncovering Implicit Mechanisms in Graph Contrastive Learning

Xiaojun Guo, Yifei Wang, Zeming Wei +1

cs.CR2026

AgentWorm: Self-Propagating Attacks Across LLM Agent Ecosystems

Yihao Zhang, Zeming Wei, Xiaokun Luan +7

The paper introduces AgentWorm, a self-replicating worm that can autonomously infect and spread across large-scale LLM-based agent ecosystems by hijacking configurations and execut…

#llm agents#self-replicating worm#agent ecosystems#security
cs.LG2024

On the Duality Between Sharpness-Aware Minimization and Adversarial Training

Yihao Zhang, Hangzhou He, Jingyu Zhu +3

cs.LG2026

Absorber LLM: Harnessing Causal Synchronization for Test-Time Training

Zhixin Zhang, Shabo Zhang, Chengcan Wu +2

cs.CR2025

Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval

Taiye Chen, Zeming Wei, Ang Li +1

cs.LG2026

SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing

Jialong Sun, Zeming Wei, Jiaxuan Zou +6

cs.LG2026

When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study

Jun Yan, Weiquan Huang, Jiankai Zuo +4

cs.CL2025

Advancing LLM Safe Alignment with Safety Representation Ranking

Tianqi Du, Zeming Wei, Quan Chen +2

cs.LG2024

Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models

Yihao Zhang, Zeming Wei, Jun Sun +1

cs.LG2023

Sharpness-Aware Minimization Alone can Improve Adversarial Robustness

Zeming Wei, Jingyu Zhu, Yihao Zhang

cs.CL2022

Extracting Weighted Finite Automata from Recurrent Neural Networks for Natural Languages

Zeming Wei, Xiyue Zhang, Meng Sun

cs.CR2026

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

Chang Jin, An Wang, Zeming Wei +7

cs.CR2026

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

Zeming Wei, Chengcan Wu, Meng Sun

cs.LG2025

Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection

Chengcan Wu, Zeming Wei, Huanran Chen +2

cs.LG2024

Fight Back Against Jailbreaking via Prompt Adversarial Tuning

Yichuan Mo, Yuji Wang, Zeming Wei +1

cs.CR2024

Jatmo: Prompt Injection Defense by Task-Specific Finetuning

Julien Piet, Maha Alrashed, Chawin Sitawarin +5

cs.LG2024

Automata Extraction from Transformers

Yihao Zhang, Zeming Wei, Meng Sun

cs.AI2025

Revisiting Hallucination Detection with Effective Rank-based Uncertainty

Rui Wang, Zeming Wei, Guanzhang Yue +1

cs.LG2026

Secure LLM Fine-Tuning via Safety-Aware Probing

Chengcan Wu, Zhixin Zhang, Zeming Wei +3

cs.CR2026

TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems

Kai Wang, Biaojie Zeng, Zeming Wei +7

cs.CL2025

False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize

Cheng Wang, Zeming Wei, Qin Liu +1

cs.SC2026

Symbolic-Neural Soft-Logic Reasoning: Towards Robust and Verifiable Thinking Chains via Cooperative Evolution

Rui Wang, Zeming Wei, Yihao Zhang +1

cs.LG2023

Using Z3 for Formal Modeling and Verification of FNN Global Robustness

Yihao Zhang, Zeming Wei, Xiyue Zhang +1

cs.LG2024

A Theoretical Understanding of Self-Correction through In-context Alignment

Yifei Wang, Yuyang Wu, Zeming Wei +2

cs.CL2024

Exploring the Robustness of In-Context Learning with Noisy Labels

Chen Cheng, Xinzhi Yu, Haodong Wen +4

cs.LG2023

CFA: Class-wise Calibrated Fair Adversarial Training

Zeming Wei, Yifei Wang, Yiwen Guo +1

cs.LG2024

Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations

Zeming Wei, Yifei Wang, Ang Li +2

cs.LG2026

Hyperball May Not Be a Free Lunch

Yihao Xiao, Jialong Sun, Zitian Gao +5

cs.LG2025

Decoding Large Language Diffusion Models with Foreseeing Movement

Yichuan Mo, Quan Chen, Mingjie Li +2

cs.CV2025

3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians

Zeming Wei, Junyi Lin, Yang Liu +4