1 paper · 1 filter
Bolian Li, Yifan Wang, Yi Ding +3
Reinforcement learning (RL) has enabled complex reasoning abilities in large language models (LLMs). However, most RL algorithms suffer from performance saturation, preventing cont…