1 paper · 1 filter
Louie Hong Yao, Nicholas Jarvis, Tiffany Zhan +3
Standard LLM evaluation practices compress diverse abilities into single scores, obscuring their inherently multidimensional nature. We present JE-IRT, a geometric item-response fr…