1 paper · 1 filter
Seong Jin Lee, Will Wei Sun, Yufeng Liu
Reinforcement learning from human feedback (RLHF) has become a cornerstone for aligning large language models with human preferences. However, the heterogeneity of human feedback,…