1 paper · 1 filter
Mohit Raghavendra, Junmo Kang, Alan Ritter
Post-training of Large Language Models often involves a pipeline of Supervised Finetuning (SFT) followed by Preference Finetuning (PFT) using methods like Direct Preference Optimiz…