1 paper
Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec +1
As jailbreaks, adversarially crafted inputs that bypass safety constraints, continue to be discovered in Large Language Models, practitioners increasingly rely on fine-tuning as a…