1 paper
Qing Ding, Eric Hua Qing Zhang, Felix Jozsa +1
Large language models (LLMs) are increasingly used in healthcare, yet standardised benchmarks for evaluating guideline-based clinical reasoning are missing. This study introduces a…