1 paper
Hangzhan Jin, Sitao Luan, Tianwei Ni +5
Supervised Fine-Tuning (SFT) followed by Reinforcement Learning (RL) is a standard post-training recipe for improving Large Language Models (LLM) reasoning, but why it works remain…