1 paper · 1 filter
Ting-Yu Chen, Tingting Yu, Pei-Cing Huang +3
Confidence calibration in large language models (LLMs) is commonly evaluated by comparing predicted confidence with observed accuracy. However, such approaches do not model item di…