2 papers
cs.AI2026
AcademiClaw: When Students Set Challenges for AI Agents
Junjie Yu, Pengrui Lu, Weiye Si +75
Benchmarks within the OpenClaw ecosystem have thus far evaluated exclusively assistant-level tasks, leaving the academic-level capabilities of OpenClaw largely unexamined. We intro…
cs.CL2025
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
Yiming Cui, Xin Yao, Yuxuan Qin +3
Multimodal scientific reasoning remains a significant challenge for large language models (LLMs), particularly in chemistry, where problem-solving relies on symbolic diagrams, mole…