1 paper
Yue Yu, Zhengxing Chen, Aston Zhang +10
Reward modeling is crucial for aligning large language models (LLMs) with human preferences, especially in reinforcement learning from human feedback (RLHF). However, current rewar…