1 paper
Hyeonji Kim, Sujeong Oh, Sanghack Lee
Reinforcement learning from human feedback (RLHF) is widely used to align large language models (LLMs) with human preferences. However, RLHF-trained reward models often exhibit len…