1 paper · 1 filter
Adhyyan Narang, Artin Tajdini, Claire Zhang +1
Recent work shows that fine-tuning language models on even a small amount of poisoned data can install targeted misbehavior, and ostensibly benign data can transmit hidden preferen…