1 paper
Haijiang Li, Chengyu Lv, Yi Zhang +12
Verifiable rewards improve language models through reliable task-level feedback, but methods based on Group Relative Policy Optimization (GRPO) apply a sequence-level advantage uni…