1 paper
Dahai Yu, Rongchao Xu, Lin Jiang +2
While large language models (LLMs) exhibit impressive reasoning capabilities, response-level confidence may remain unreliable when intermediate claims conflict with the final concl…