1 paper
Sangwon Baek, Kyu Yeon Hur, Kyunga Kim
Clinical AI evaluation increasingly delegates scoring to large language models (LLMs) acting as AI raters, yet their scoring behavior across evaluation conditions has not been quan…