1 citations · 2 across the 9 of their papers we have counts for
1 paper · 1 filter
Weixiang Zhao, Jiahe Guo, Yulin Hu +8
Despite extensive efforts in safety alignment, large language models (LLMs) remain vulnerable to jailbreak attacks. Activation steering offers a training-free defense method but re…