1 paper
Matteo Leonesi, Francesco Belardinelli, Flavio Corradini +1
Alignment faking (AF) occurs when an LLM strategically complies with training objectives to avoid value modification, reverting to prior preferences once monitoring is lifted. Curr…