1 paper
Yuhang Lai, Siyuan Wang, Shujun Liu +2
We introduce ALaRM, the first framework modeling hierarchical rewards in reinforcement learning from human feedback (RLHF), which is designed to enhance the alignment of large lang…