Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models
Fangzhou Chen, Shiji Zhao, Mengyang Wang +4
Large language models (LLMs) remain vulnerable to harmful requests and jailbreak attacks. Parameter-efficient safety alignment methods based on prompt tuning typically rely on a si…
cs.LG2024
Improving Adversarial Robust Fairness via Anti-Bias Soft Label Distillation
Shiji Zhao, Ranjie Duan, Xizhe Wang +1
Adversarial Training (AT) has been widely proved to be an effective method to improve the adversarial robustness against adversarial examples for Deep Neural Networks (DNNs). As a…