1 paper · 1 filter
Dongdong Zhao, Jian Chen, Guancheng Lin +3
Code generation benchmarks are widely used to evaluate Large Language Models (LLMs), but benchmark data leakage into training sets can inflate performance and undermine evaluation…