1 paper
Yuchen Cai, Ding Cao, Xin Xu +7
Recent advances in reasoning capabilities of large language models (LLMs) are largely driven by reinforcement learning (RL), yet the underlying parameter dynamics during RL trainin…