1 paper
Kun Qian, Shunji Wan, Claudia Tang +4
As large language models achieve impressive scores on traditional benchmarks, an increasing number of researchers are becoming concerned about benchmark data leakage during pre-tra…