1 paper
Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca +6
Large language models are increasingly deployed in safety-critical applications, where their ability to resist harmful instructions is essential. Although post-training aims to mak…