1 paper
Chongyang He, Rui Zhang, Zixuan Wang +1
Post-training Small Language Models (SLMs) for reasoning typically follows an SFT-then-RL pipeline, yet existing work rarely considers what data should be learned at each stage. We…