1 paper
Zhangyi Hu, Chenhui Liu, Tian Huang +6
Recently, Reinforcement Learning with Verifiable Rewards (RLVR) and Test-Time Scaling (TTS) have advanced LLM code generation through executable verification. Yet Ground-Truth Unit…