1 paper
Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler +10
We introduce PhysicianBench, a benchmark for evaluating LLM agents on physician tasks grounded in real clinical setting within electronic health record (EHR) environments. Existing…