1 paper · 1 filter
Xingyu Fan, Wei Shao, Jiacheng Liu +2
Reward models (RMs) are central to aligning large language models (LLMs) with human preferences, powering RLHF and advanced decoding strategies. While most prior work focuses on si…