1 paper
Kangkun Mao, Jinru Ding, Jiayuan Chen +6
As large language models (LLMs) enter the medical domain, most benchmarks evaluate them on question answering or descriptive reasoning, overlooking quantitative reasoning critical…