3 papers
cs.CL2026
WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning
Yizhou Chi, Eric Chamoun, Zifeng Ding +1
Forecasting real-world events requires language-model agents to reason under uncertainty from incomplete, time-bounded information. Yet evaluating whether agents genuinely forecast…
cs.CL2026
DeliChess: A Multi-party Dialogue Dataset for Deliberation in Chess Puzzle Solving
Xiaochen Zhu, Georgi Karadzhov, Tom Stafford +1
Multi-party dialogue is a critical setting for studying collaborative reasoning and decision-making, yet existing datasets rarely focus on structured, reasoning-intensive tasks. We…
cs.CL2026
Multimodal Claim Extraction for Fact-Checking
Joycelyn Teo, Rui Cao, Zhenyun Deng +3
Automated Fact-Checking (AFC) relies on claim extraction as a first step, yet existing methods largely overlook the multimodal nature of today's misinformation. Social media posts…