1 paper · 1 filter
Shadi Hamdan, Deniz Yuret
Large language models (LLMs) undergo a three-phase training process: unsupervised pre-training, supervised fine-tuning (SFT), and learning from human feedback (RLHF/DPO). Notably,…