2 papers
cs.CL2026
How Many Code and Test Cases Are Enough? Evaluating Test Cases Generation from a Binary-Matrix Perspective
Xianzhen Luo, Jinyang Huang, Wenzhen Zheng +5
Evaluating test cases automatically generated by Large Language Models (LLMs) is a critical yet challenging task. Existing benchmarks often evaluate the exclusion ratio on large, u…
cs.SE2025
MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenarios
Jinyang Huang, Xiachong Feng, Qiguang Chen +6
Code debugging is a crucial task in software engineering, which attracts increasing attention. While remarkable success has been made in the era of large language models (LLMs), cu…