1 paper
Yaowen Ye, Cassidy Laidlaw, Jacob Steinhardt
Language model (LM) post-training relies on two stages of human supervision: task demonstrations for supervised finetuning (SFT), followed by preference comparisons for reinforceme…