1 paper
Xiyuan Zhou, Zhuoqi Li, Xinlei Wang +6
Data contamination undermines the reliable evaluation of large language models (LLMs) on mathematical problem solving. While rewriting-based evaluation mitigates memorization, exis…