1 paper · 1 filter
Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4
Reliable evaluation of open-ended question answering remains a bottleneck for measuring answer correctness of modern LLMs. Unlike multiple-choice tasks, free-form answers may be co…