1 paper · 1 filter
Darragh Quinn, David Dylan, Roisin Healy +3
Evaluating language-model agents at scale increasingly relies on a second language model as an automatic judge, because the gold signal, an executable environment reward, is expens…