1 paper · 1 filter
Hao Jiang, Shurui Li, Tianpeng Bu +7
Recent advances in online reinforcement learning (RL) for large language models (LLMs) have demonstrated promising performance in complex reasoning tasks. However, they often exhib…