5 papers
Extractive Summarization for Arabic Documents Using SAraBERT with a Semantic Siamese Similarity Evaluation Metric
Sami Shames El Deen, Mariette Awad
In this research, we introduce SAraBERT, an enhanced version of AraBERT which proposes inter-sentence transformer layers for extractive summarization tasks. To ensure that the summ…
Obscuring Data Contamination Through Translation: Evidence from Arabic Corpora
Chaymaa Abbas, Nour Shamaa, Mariette Awad
Data contamination undermines the validity of Large Language Model evaluation by enabling models to rely on memorized benchmark content rather than true generalization. While prior…
ChartComplete: A Taxonomy-based Inclusive Chart Dataset
Ahmad Mustapha, Charbel Toumieh, Mariette Awad
With advancements in deep learning (DL) and computer vision techniques, the field of chart understanding is evolving rapidly. In particular, multimodal large language models (MLLMs…
Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?
Chaymaa Abbas, Mariette Awad, Razane Tajeddine
Style-conditioned data poisoning is identified as a covert vector for amplifying sociolinguistic bias in large language models. Using small poisoned budgets that pair dialectal pro…
AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects
Ahmad Mustapha, Hadi Al-Khansa, Hadi Al-Mubasher +5
Large Language Models (LLMs) have shown remarkable capabilities, not only in generating human-like text, but also in acquiring knowledge. This highlights the need to go beyond the…