1 paper
Alex Sotiropoulos, Sulyab Thottungal Valapu, Linus Lei +2
Large Language Models (LLMs) increasingly rely on Supervised Fine-Tuning (SFT) and Reinforcement Learning from Human Feedback (RLHF) to align model responses with human preferences…