1 paper
Hangzhan Jin, Sicheng Lv, Sifan Wu +1
Training large language models (LLMs) from scratch is increasingly impractical, making post-training methods such as supervised fine-tuning (SFT) and reinforcement-learning fine-tu…