Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
VIABLE: A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
Yi Zhao, Siqi Wang, Zhe Hu +2
AI-based Visually Impaired Assistance (VIA) remains challenging, largely due to the high cost of human evaluation. The VLM-as-a-Judge paradigm may offer a promising alternative, al…
cs.CL2024
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
Erxin Yu, Jing Li, Ming Liao +4
As large language models (LLMs) constantly evolve, ensuring their safety remains a critical research problem. Previous red-teaming approaches for LLM safety have primarily focused…