1 paper · 1 filter
Taojie Zhu, Dongyang Xu, Ding Zou +4
Post-training paradigms for Large Language Models (LLMs), primarily Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL), face a fundamental dilemma: SFT provides stability…