1 paper
Shahbaz Siddeeq, Muhammad Waseem, Umar Subhan Malhi +1
Large Language Models are increasingly evaluated for code generation using test-based benchmarks. The validity of such evaluations depends on the reliability of their references an…