2 papers
cs.AI2026
Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?
Zewen Liu, Juntong Ni, Xianfeng Tang +4
Uncovering hidden symbolic laws from time series data, as an aspiration dating back to Kepler's discovery of planetary motion, remains a core challenge in scientific discovery and…
cs.CL2026
M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency
Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou +2
Evaluating scientific arguments requires assessing the strict consistency between a claim and its underlying multimodal evidence. However, existing benchmarks lack the scale, domai…