1 paper
Jiangnan Li, Thuy-Trang Vu, Ehsan Abbasnejad +1
Conventionally, supervised fine-tuning (SFT) is treated as a simple imitation learning process that only trains a policy to imitate expert behavior on demonstration datasets. In th…