1 paper · 1 filter
Nora Petrova, Andrew Gordon, Enzo Blindow
The evaluation of large language models faces significant challenges. Technical benchmarks often lack real-world relevance, while existing human preference evaluations suffer from…