1 paper · 1 filter
Xin He, Yanlin Wang, Mingwei Liu +3
Repository-level software engineering benchmarks have significantly advanced the evaluation of coding agents, but existing benchmarks primarily measure whether generated patches pa…