1 paper · 1 filter
Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage +4
This study evaluated self-reported response certainty across several large language models (GPT, Claude, Llama, Phi, Mistral, Gemini, Gemma, and Qwen) using 300 gastroenterology bo…