2 papers
cs.CL2026
Obscuring Data Contamination Through Translation: Evidence from Arabic Corpora
Chaymaa Abbas, Nour Shamaa, Mariette Awad
Data contamination undermines the validity of Large Language Model evaluation by enabling models to rely on memorized benchmark content rather than true generalization. While prior…
cs.CL2025
Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?
Chaymaa Abbas, Mariette Awad, Razane Tajeddine
Style-conditioned data poisoning is identified as a covert vector for amplifying sociolinguistic bias in large language models. Using small poisoned budgets that pair dialectal pro…