1 paper · 1 filter
Chao Wang, Hongtao Tian, Tao Yang +3
Group Relative Policy Optimization (GRPO) is a default recipe for process-supervised reinforcement learning of LLM reasoners, and dense process supervision -- via learned process r…