3 papers
cs.CL2026
HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam
Weiqi Zhai, Zhihai Wang, Jinghang Wang +35
Humanity's Last Exam (HLE) has become a widely used benchmark for evaluating frontier large language models on challenging, multi-domain questions. However, community-led analyses…
cs.CL2025
Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
Wenjie Luo, Ruocheng Li, Shanshan Zhu +1
Despite significant advancements, current large language models (LLMs) and vision-language models (LVLMs) continue to struggle with complex, multi-step, cross-modal common sense re…
cs.CR2024
CopyrightMeter: Revisiting Copyright Protection in Text-to-image Models
Naen Xu, Changjiang Li, Tianyu Du +8
Text-to-image diffusion models have emerged as powerful tools for generating high-quality images from textual descriptions. However, their increasing popularity has raised signific…