1 paper · 1 filter
Shuyang Xie, Shuxiao Xie, Feng Zhu +2
Online-judge verdicts and the datasets and benchmarks built on them are treated as ground truth for evaluating and training large language models for code. Yet prior audits have so…