1 paper · 1 filter
Yang Zhao, Hepeng Wang, Xiao Ding +8
Group-Relative Policy Optimization (GRPO) has emerged as an efficient paradigm for aligning Large Language Models (LLMs), yet its efficacy is primarily confined to domains with ver…