Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
Qiyao Yan, Chenpeng Wang, Liangming Pan
When a large language model fails a reasoning task, it is often assumed to lack the underlying capability. However, this conflates a genuine absence of reasoning with a late-stage…
cs.AI2026
HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs
Yucheng Wu, Jundong Xu, Mingzhen Ju +4
Logical reasoning is essential for reliable AI, yet existing benchmarks are largely first-order-logic-centric, focusing on object-level deduction over fixed predicates. This misses…