1 paper
Anthony Hughes, Nicole Xing, Collin Francel +2
As large language models (LLMs) are deployed in high-stakes domains, adversaries may poison training data to implant backdoors: hidden triggers that covertly manipulate model behav…