1 paper
Nora Petrova, Andrew Gordon, Enzo Blindow
The evaluation of large language models faces significant challenges. Technical benchmarks often lack real-world relevance, while existing human preference evaluations suffer from…