1 paper · 1 filter
Hussein Mozannar, Valerie Chen, Mohammed Alsobay +7
Evaluation of large language models for code has primarily relied on static benchmarks, including HumanEval (Chen et al., 2021), or more recently using human preferences of LLM res…