1 paper
Longwen Wang, Yirui Liu, Xuan'er Wu +6
Effective reward design is a central challenge in Reinforcement Learning (RL) for code generation. Mainstream test-suite-level outcome rewards enforce functional correctness but in…