1 paper · 1 filter
Yang Chen, Zhuolin Yang, Zihan Liu +5
Despite recent progress in large-scale reinforcement learning (RL) for reasoning, the training recipe for building high-performing reasoning models remains elusive. Key implementat…