2 papers
cs.CL2026
ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
Siqi Sun, Ben Peng Wu, Mali Jin +3
As corporate responsibility increasingly incorporates environmental, social, and governance (ESG) criteria, ESG reporting is becoming a legal requirement in many regions and a key…
cs.CV2025
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
Zijian Ling, Han Zhang, Yazhuo Zhou +1
This paper presents ColorBlindnessEval, a novel benchmark designed to evaluate the robustness of Vision-Language Models (VLMs) in visually adversarial scenarios inspired by the Ish…