1 paper · 1 filter
Jan Niklas Groeneveld, Xi Qin, Alexander Schaefer +1
Generating high-quality code remains a challenge for Large Language Models (LLMs). For the evolution of reasoning models on this task, reward models are a necessary intermediate st…