1 paper · 1 filter
Oliver Normand, Esther Borsi, Mitch Fruin +6
Large language models (LLMs) often match or exceed clinician-level performance on medical benchmarks, yet very few are evaluated on real clinical data or examined beyond headline m…