1 paper
Zhenwen Liang, Yujun Zhou, Sidi Lu +3
Reinforcement Learning (RL) enhances LLM reasoning, yet a paradox emerges as models scale: strong base models saturate standard benchmarks (e.g., MATH), yielding correct but homoge…