1 paper
Hongzhou Rao, Yanjie Zhao, Wenjie Zhu +3
Concerns about benchmark leakage in large language models for code (Code LLMs) have raised issues of data contamination and inflated evaluation metrics. The diversity and inaccessi…