From the 1 of 1 linked paper with an AI index.
1 paper
Anthony Hughes, Nicole Xing, Collin Francel +2
The paper introduces ToxScreen, a benchmark of backdoored large language models, and evaluates methods for recovering hidden triggers under realistic defender constraints, finding…