1 paper · 1 filter
Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi +3
Reliable evaluation of large language models in surgery remains underdeveloped. Broad medical benchmarks test clinical knowledge, while surgery requires procedural reasoning, manag…