1 paper
George Ma, Benjamin Mikek, Haoyu Li +9
Ensuring the correctness of LLM-generated code is a core challenge for modern software engineering. Benchmarks for agentic code generation check correctness with held-out test suit…