1 paper · 1 filter
Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen +2
Language models are commonly fine-tuned for safety alignment to refuse harmful prompts. One approach fine-tunes them to generate categorical refusal tokens that distinguish differe…