1 paper
Noam Tarshish, Nofar Selouk, Daniel Hodisan +4
Instructed code editing is a significant challenge for large language models (LLMs). On the EditBench benchmark, 39 of 40 evaluated models obtain a task success rate (TSR) below 60…