1 paper · 1 filter
Angelina Wang, Daniel E. Ho, Sanmi Koyejo
Standard offline evaluations for language models -- a series of independent, state-less inferences made by models -- fail to capture how language models actually behave in practice…