1 paper
Samuel Schmidgall, Rojin Ziaei, Carl Harris +3
Evaluating large language models (LLM) in clinical scenarios is crucial to assessing their potential clinical utility. Existing benchmarks rely heavily on static question-answering…