Publications (44)
Boosting Jailbreak Attack with Momentum
Yihao Zhang, Zeming Wei
Unveiling the Basin-Like Loss Landscape in Large Language Models
Huanran Chen, Yinpeng Dong, Zeming Wei +4
MILE: A Mutation Testing Framework of In-Context Learning Systems
Zeming Wei, Yihao Zhang, Meng Sun
Weighted Automata Extraction and Explanation of Recurrent Neural Networks for Natural Language Tasks
Zeming Wei, Xiyue Zhang, Yihao Zhang +1
Identifying and Understanding Cross-Class Features in Adversarial Training
Zeming Wei, Yiwen Guo, Yisen Wang
Automata-Based Steering of Large Language Models for Diverse Structured Generation
Xiaokun Luan, Zeming Wei, Yihao Zhang +1
Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation
Tianqi Du, Lizhe Fang, Weijie Yang +4
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
Zeming Wei, Qiaosheng Zhang, Xia Hu +1
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
Zhixin Zhang, Zeming Wei, Meng Sun
RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
Zeming Wei, Zhixin Zhang, Chengcan Wu +3
Towards the Worst-case Robustness of Large Language Models
Huanran Chen, Yinpeng Dong, Zeming Wei +2
Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation
Chengcan Wu, Zhixin Zhang, Mingqian Xu +2
Stabilizing Multi-Attack Adversarial Training via Bandit Optimization
Rui Wang, Zeming Wei, Xiyue Zhang +1
The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems
Yihao Zhang, Kai Wang, Jiangrong Wu +7
Architecture Matters: Uncovering Implicit Mechanisms in Graph Contrastive Learning
Xiaojun Guo, Yifei Wang, Zeming Wei +1
AgentWorm: Self-Propagating Attacks Across LLM Agent Ecosystems
Yihao Zhang, Zeming Wei, Xiaokun Luan +7
The paper introduces AgentWorm, a self-replicating worm that can autonomously infect and spread across large-scale LLM-based agent ecosystems by hijacking configurations and execut…
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
Yihao Zhang, Hangzhou He, Jingyu Zhu +3
Absorber LLM: Harnessing Causal Synchronization for Test-Time Training
Zhixin Zhang, Shabo Zhang, Chengcan Wu +2
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
Taiye Chen, Zeming Wei, Ang Li +1
SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing
Jialong Sun, Zeming Wei, Jiaxuan Zou +6
When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study
Jun Yan, Weiquan Huang, Jiankai Zuo +4
Advancing LLM Safe Alignment with Safety Representation Ranking
Tianqi Du, Zeming Wei, Quan Chen +2
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
Yihao Zhang, Zeming Wei, Jun Sun +1
Sharpness-Aware Minimization Alone can Improve Adversarial Robustness
Zeming Wei, Jingyu Zhu, Yihao Zhang
Extracting Weighted Finite Automata from Recurrent Neural Networks for Natural Languages
Zeming Wei, Xiyue Zhang, Meng Sun
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
Chang Jin, An Wang, Zeming Wei +7
ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction
Zeming Wei, Chengcan Wu, Meng Sun
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
Chengcan Wu, Zeming Wei, Huanran Chen +2
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
Yichuan Mo, Yuji Wang, Zeming Wei +1
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
Julien Piet, Maha Alrashed, Chawin Sitawarin +5
Automata Extraction from Transformers
Yihao Zhang, Zeming Wei, Meng Sun
Revisiting Hallucination Detection with Effective Rank-based Uncertainty
Rui Wang, Zeming Wei, Guanzhang Yue +1
Secure LLM Fine-Tuning via Safety-Aware Probing
Chengcan Wu, Zhixin Zhang, Zeming Wei +3
TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems
Kai Wang, Biaojie Zeng, Zeming Wei +7
False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize
Cheng Wang, Zeming Wei, Qin Liu +1
Symbolic-Neural Soft-Logic Reasoning: Towards Robust and Verifiable Thinking Chains via Cooperative Evolution
Rui Wang, Zeming Wei, Yihao Zhang +1
Using Z3 for Formal Modeling and Verification of FNN Global Robustness
Yihao Zhang, Zeming Wei, Xiyue Zhang +1
A Theoretical Understanding of Self-Correction through In-context Alignment
Yifei Wang, Yuyang Wu, Zeming Wei +2
Exploring the Robustness of In-Context Learning with Noisy Labels
Chen Cheng, Xinzhi Yu, Haodong Wen +4
CFA: Class-wise Calibrated Fair Adversarial Training
Zeming Wei, Yifei Wang, Yiwen Guo +1
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
Zeming Wei, Yifei Wang, Ang Li +2
Hyperball May Not Be a Free Lunch
Yihao Xiao, Jialong Sun, Zitian Gao +5
Decoding Large Language Diffusion Models with Foreseeing Movement
Yichuan Mo, Quan Chen, Mingjie Li +2
3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians
Zeming Wei, Junyi Lin, Yang Liu +4