1 paper
Haodong Zhao, Tianyi Xu, Tianhang Zhao +2
Fine-tuning Large Language Models with untrusted data exposes models to backdoor attacks, where poisoned samples cause targeted misbehavior. Existing sample-filtering defenses rely…