1 paper · 1 filter
Mohammed Abu Baker, Lakshmi Babu-Saheer
Backdoor attacks creating 'sleeper agents' in large language models (LLMs) pose significant safety risks. This study employs mechanistic interpretability to explore resulting inter…