1 paper · 1 filter
Akash Bonagiri, Gerard Janno Anderias, Saee Patil +6
Human evaluation remains the primary standard for assessing modern AI systems, yet annotator disagreement, bias, and variability make system rankings fragile under standard majorit…