2 papers
cs.CL2026
Prompt Framing Distorts Count Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring
Dekun Yang
Count-based F1 is widely used as a proxy for LLM error-detection quality, but this paper shows that it can rise dramatically without a corresponding improvement in span localizatio…
cs.AI2026
Calibrated Selective Fact-Checking via Evidence Chain Evaluation
Dekun Yang
Large language models (LLMs) can achieve strong fact-checking accuracy, yet forced binary decisions conceal a critical reliability problem: systems may issue confident verdicts eve…