1 paper · 1 filter
Yangtian Zi, Harshitha Menon, Arjun Guha
State-of-the-art Large Language Models (LLMs) achieve high pass@1 on general benchmarks like HumanEval but underperform on specialized suites such as ParEval. Is this due to LLMs m…