1 paper · 1 filter
Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia +1
Jailbreak attacks expose a persistent gap between the intended safety behavior of aligned large language models and their behavior under adversarial prompting. Existing automated m…