Showing cs.CLShow all
3 papers · 1 filter
cs.CL2026
Automatic Replication of LLM Mistakes in Medical Conversations
Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko +1
Large language models (LLMs) are increasingly evaluated in clinical settings using multi-dimensional rubrics which quantify reasoning quality, safety, and patient-centeredness. Yet…
cs.CL2025★ 1 cited
A Women's Health Benchmark for Large Language Models
Victoria-Elisabeth Gruber, Razvan Marinescu, Diego Fajardo +13
As large language models (LLMs) become primary sources of health information for millions, their accuracy in women's health remains critically unexamined. We introduce the Women's…
cs.CL2025
MedPI: Evaluating AI Systems in Medical Patient-facing Interactions
Diego Fajardo V., Oleksii Proniakin, Victoria-Elisabeth Gruber +1
We present MedPI, a high-dimensional benchmark for evaluating large language models (LLMs) in patient-clinician conversations. Unlike single-turn question-answer (QA) benchmarks, M…