1 paper
Robin Haselhorst, Lucie Flek, Florian Mai
Large language models can hide hidden behaviors that activate only under narrow conditions, such as backdoor triggers, sleeper-agent deployment cues, sandbagging, or topic-conditio…