1 paper
Antoni Lasik, Jakub Pokrywka, Åukasz Grzybowski +7
Large language models (LLMs) in medicine are mainly evaluated using multiple-choice question answering (MCQA), which can overestimate real clinical ability due to guessing strategi…