1 paper · 1 filter
Javier Rando, Francesco Croce, Kryštof Mitka +4
Large language models are aligned to be safe, preventing users from generating harmful content like misinformation or instructions for illegal activities. However, previous work ha…