1 paper · 1 filter
Wenpeng Xing, Mohan Li, Bohan Yang +5
Safety-aligned large language models can still be manipulated through white-box interventions that modify their internal representations. We introduce Latent Fusion Jailbreak (LFJ)…