1 paper · 1 filter
Cameron Pattison, Lorenzo Manuali, Seth Lazar
Safety-trained language models routinely refuse requests for help circumventing rules. But not all rules deserve compliance. When users ask for help evading rules imposed by an ill…