1 paper
Jinyang Wu, Chonghua Liao, Mingkuan Feng +6
Reinforcement learning (RL) has emerged as an effective paradigm for enhancing model reasoning. However, existing RL methods like GRPO typically rely on unstructured self-sampling…