1 paper · 1 filter
Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1
Reliable evaluation is essential for understanding large language model (LLM) performance, yet today's go-to metrics, namely token-overlap scores (e.g., ROUGE) and embedding-based…