2 papers
cs.CL2026
GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space
Boqi Chen, Xudong Liu, Yunke Ao +2
Large Language Models (LLMs) show great potential as clinical agents, yet existing benchmarks reduce clinical workflows to static predictions or unconstrained Markov Decision Proce…
cs.CL2026
MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models
Boqi Chen, Xudong Liu, Jiachuan Peng +5
Multimodal large language models (MLLMs) have shown great potential in medical applications, yet existing benchmarks inadequately capture real-world clinical complexity. We introdu…