1 paper · 1 filter
Kun Qian, Shunji Wan, Claudia Tang +4
As large language models achieve impressive scores on traditional benchmarks, an increasing number of researchers are becoming concerned about benchmark data leakage during pre-tra…