1 paper
Xinning Li, Kemunto Ochwang'i, Aryasomayajula Ram Bharadwaj +2
Frontier large language models can often recognize when they are being evaluated, a capability known as evaluation awareness. If models behave differently in evaluations than in de…