Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
Veronica Chatrath, Bryan Zhu, George Pu +16
Large language models perform strongly on medical knowledge benchmarks, but reliable clinical deployment requires agents to conduct defensible investigations over heterogeneous, lo…
cs.AI2026
FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis
Soham Dan
We introduce FindStatBench, an execution benchmark for evaluating large language models on combinatorial code synthesis. Built from FindStat, it contains 2,329 tasks across 24 coll…