2 citations · 2 across the 2 of their papers we have counts for
1 paper · 1 filter
Kyle O'Brien, David Majercak, Xavier Fernandes +7
Responsible deployment of language models requires mechanisms for refusing unsafe prompts while preserving model performance. While most approaches modify model weights through add…