1 paper
Xueyan Niu, Bo Bai, Wei Han +1
Post-training of large language models routinely interleaves supervised fine-tuning (SFT) with reinforcement learning (RL). These two methods have different objectives: SFT minimiz…