1 paper · 1 filter
Siyao Song, Cong Ma, Zhihao Cheng +5
Large language models (LLMs) have recently advanced in reasoning when optimized with reinforcement learning (RL) under verifiable rewards. Existing methods primarily rely on outcom…