1 paper · 1 filter
Shuyang Jiang, Yuhao Wang, Ya Zhang +2
Current critic-free RL methods for large reasoning models suffer from severe inefficiency when training on positive homogeneous prompts (where all rollouts are correct), resulting…