1 paper · 1 filter
Haoxuan Chen, Tianming Liang, Wei-Shi Zheng +1
Reinforcement learning with verifiers (RLVR) has become a central paradigm for improving LLM reasoning, yet popular group-based optimization algorithms like GRPO often suffer from…