1 paper · 1 filter
Xinning Li, Kemunto Ochwang'i, Aryasomayajula Ram Bharadwaj +2
Frontier large language models can often recognize when they are being evaluated, a capability known as evaluation awareness. If models behave differently in evaluations than in de…