1 paper
Tongtong Wu, Rongyi Chen, Wenjie Du +6
Recent progress in large language models (LLMs) has improved code generation, but most evaluations still test isolated, small-scale code (e.g., a single function) under default or…