1 paper
Scott Blyth, Sherlock A. Licorish, Christoph Treude +1
Large language models (LLMs) have demonstrated impressive capabilities in code generation, achieving high scores on benchmarks such as HumanEval and MBPP. However, these benchmarks…