1 paper
Lizhuo Zhang, Mengmeng Tang, Chenfeng Long +2
Agreement among repeated samples of a language model is routinely read as evidence about answer reliability, yet wrong answers can agree just as strongly as right ones. This paper…