1 paper
Maria Ana Cardei, Josephine Lamp, Mark Derdzinski +1
We present DM-Bench, the first benchmark designed to evaluate large language model (LLM) performance across real-world decision-making tasks faced by individuals managing diabetes…