1 paper · 1 filter
Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1
Large language models typically undergo post-training to align them with safety policies but there exist many sophisticated jailbreaks that sidestep established safeguards. For ins…