1 paper · 1 filter
Wenpeng Xing, Bohan Yang, Mohan Li +5
Safety-aligned large language models can still be manipulated through white-box interventions that modify their internal representations. We introduce Latent Fusion Jailbreak (LFJ)…