1 paper
Abhijit Kumar, Natalya Kumar, Shikhar Gupta
Critic-free reinforcement learning with verifiable rewards (RLVR) improves code generation by optimizing unit-test pass rates, but GRPO-style updates suffer from coarse credit assi…