Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam
Weiqi Zhai, Zhihai Wang, Jinghang Wang +33
Humanity's Last Exam (HLE) has become a widely used benchmark for evaluating frontier large language models on challenging, multi-domain questions. However, community-led analyses…
cs.CL2025
Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
Wenjie Luo, Ruocheng Li, Shanshan Zhu +1
Despite significant advancements, current large language models (LLMs) and vision-language models (LVLMs) continue to struggle with complex, multi-step, cross-modal common sense re…