1 paper
Jingwei Shi, Xinxiang Yin, Jing Huang +2
The evaluation of Large Language Models (LLMs) for code generation relies heavily on the quality and robustness of test cases. However, existing benchmarks often lack coverage for…