1 paper · 1 filter
Yupei Yang, Lin Yang, Wanxi Deng +5
A reliable reward model is essential for aligning large language models with human preferences through reinforcement learning from human feedback. However, standard reward models a…