1 paper · 1 filter
Caleb DeLeeuw
Biosecurity evaluations of language models typically ask whether models produce hazardous output. This paper asks a complementary question: when a model refuses, is that refusal st…