1 paper
Ruiqi Zhong, Dhruba Ghosh, Dan Klein +1
Larger language models have higher accuracy on average, but are they better on every single instance (datapoint)? Some work suggests larger models have higher out-of-distribution r…