1 paper
Xuan Li, Zhanke Zhou, Zongze Li +4
Large language models (LLMs) benefit substantially from supervised fine-tuning (SFT) and reinforcement learning with verifiable rewards (RLVR) in reasoning tasks. However, these re…