1 paper
Chaymaa Abbas, Nour Shamaa, Mariette Awad
Data contamination undermines the validity of Large Language Model evaluation by enabling models to rely on memorized benchmark content rather than true generalization. While prior…