2 papers
cs.AI2026
VERT: Reliable LLM Judges for Radiology Report Evaluation
Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens +1
Current literature on radiology report evaluation has focused primarily on designing LLM-based metrics and fine-tuning small models for chest X-rays. However, it remains unclear wh…
cs.CL2026
CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
Federica Bologna, Tiffany Pan, Matthew Wilkens +2
Evaluating multi-paragraph clinical question answering (QA) systems is resource-intensive and challenging: accurate judgments require medical expertise and achieving consistent hum…