1 paper · 1 filter
Jiahui Li, Lin Li, Tai-wei Chang +4
Reinforcement learning from human feedback (RLHF) offers a promising approach to aligning large language models (LLMs) with human preferences. Typically, a reward model is trained…