1 paper · 1 filter
Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit +3
Evaluating long-context radiology report generation is challenging. NLG metrics fail to capture clinical correctness, while LLM-based metrics often lack generalizability. Clinical…