1 paper · 1 filter
Wenhao Lan, Shan Li, Xinhua Lai +4
Safety-aligned language models must refuse harmful requests without broad over-refusal, but it remains unclear how dynamic adversarial fine-tuning changes refusal-control carriers:…