4 papers
ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification
Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous +1
We present ArabicDialectSafety, a human-curated Arabic safety dataset of 25,071 prompts covering six Arabic varieties: Modern Standard Arabic, Syrian, Egyptian, Algerian, Palestini…
StanceNakba Shared Task: Actor and Topic-Aware Stance Detection in Public Discourse
Kholoud K. Aldous, Md Rafiul Biswas, Mabrouka Bessghaier +3
We present StanceNakba 2026, a shared task on stance detection in polarized social media discourse related to the Palestinian-Israeli conflict, organized as part of Nakba-NLP 2026…
Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese
Wajdi Zaghouani, Kholoud K. Aldous, Yicheng Gao
When Large Language Models (LLMs) are deployed in Chinese-language settings, a troubling pattern emerges: safety systems that work well in English break down. These systems struggl…
AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian
Wajdi Zaghouani, Kholoud K. Aldous, Isra Fejzullaj
Safety evaluation of Large Language Models (LLMs) has largely focused on high-resource languages, leaving low-resource languages critically underserved. We present AlbanianLLMSafet…