1 paper
Ting-Yu Chen, Tingting Yu, Pei-Cing Huang +3
Confidence calibration in large language models (LLMs) is commonly evaluated by comparing predicted confidence with observed accuracy. However, such approaches do not model item di…