1 paper
Havva Alizadeh Noughabi, Julien Serbanescu, Fattane Zarrinkalam +1
Despite recent advances, Large Language Models remain vulnerable to jailbreak attacks that bypass alignment safeguards and elicit harmful outputs. While prior research has proposed…