1 paper
Jing Guan, Yachao Yang, Zhaoliang Liu +3
Large language models remain fragile against malicious fine-tuning, motivating training-time defenses against harmful persona drift. Preventative Steering injects undesirable-trait…