1 paper
Ning Dai, Zheng Wu, Renjie Zheng +7
Reinforcement learning (RL) with unit test feedback has enhanced large language models' (LLMs) code generation, but relies on sparse rewards provided only after complete code evalu…