1 paper
Sarah Wyer, Sue Black, Noura Al Moubayed
Safety evaluations for large language models rely on surface-form classifiers that report declining harm scores across model generations. We provide evidence that this methodology…