Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models
Fali Wang, Ali Al-Lawati, Iliyas Bektas +5
Graph reasoning provides a promising testbed for evaluating the reasoning ability of large language models (LLMs), as graph instances can be programmatically generated, structurall…
cs.CL2025
Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking
Liangliang Zhang, Zhuorui Jiang, Hongliang Chi +8
Knowledge Graph Question Answering (KGQA) systems rely on high-quality benchmarks to evaluate complex multi-hop reasoning. However, despite their widespread use, popular datasets s…