1 paper · 1 filter
Antoni Lasik, Jakub Pokrywka, Åukasz Grzybowski +7
Large language models (LLMs) in medicine are mainly evaluated using multiple-choice question answering (MCQA), which can overestimate real clinical ability due to guessing strategi…