1 paper
Arthur Becker, Jakob Kemmler, David Thulke +3
Supervised fine-tuning (SFT) trains a base language model to imitate target responses, and these targets may require knowledge the base model has not robustly internalized. We stud…