1 paper
Mingyu Su, Jian Guan, Yuxian Gu +2
Post-training methods, especially Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL), play an important role in improving large language models' (LLMs) complex reasoning…