1 paper · 1 filter
Yiwen Zhang, Xiaodong Yan, Zhenyu Huang +6
Reinforcement Learning from Verifiable Rewards (RLVR) is pivotal for enhancing LLM code generation, yet its efficacy is often hindered by insufficient test case coverage, leading t…