1 paper · 1 filter
Zhimeng Luo, Lixin Wu, Adam Frisch +1
Accuracy-based evaluation of Large Language Models (LLMs) measures benchmark-specific performance rather than underlying medical competency: it treats all questions as equally info…