1 paper · 1 filter
Darshan Deshpande, Anand Kannappan, Rebecca Qian
Recent advances in reinforcement learning for code generation have made robust environments essential to prevent reward hacking. As LLMs increasingly serve as evaluators in code-ba…