1 paper · 1 filter
Xiaole Su, Kasey Zhang, Andy Lyu
Supervised fine-tuning (SFT) followed by Group Relative Policy Optimization (GRPO) is a common post-training recipe. We conduct a controlled ablation over SFT-GRPO data overlap, ev…