1 paper · 1 filter
Shuai Wang, Liang Ding, Li Shen +4
Establishing fair and robust benchmarks is essential for evaluating intelligent code generation by large language models (LLMs). Our survey of 35 existing benchmarks uncovers three…