1 paper · 1 filter
Farhad Abtahi, Abdolamir Karbalaie, Eduardo Illueca-Fernandez +1
Most large language model benchmarks evaluate final-answer quality but reveal little about how models revise beliefs under disagreement or conflicting evidence. We introduce MEDLEY…