1 paper
Daniel Vennemeyer, Punya Syon Pandey, Phan Anh Duong +2
Fine-tuning LLMs on benign data can still degrade alignment and adversarial robustness, yet direct analysis of the role of fine-tuning objectives in shaping these safety outcomes r…