1 paper · 1 filter
MichaÅ Brzozowski, Zuzanna Dubanowska, Enrico Cassano +1
Narrowly finetuned language models memorize implanted content verbatim, but auditing what a deployed model has been taught, without access to its weights or training data, remains…