1 paper · 1 filter
Shusheng Xu, Wei Fu, Jiaxuan Gao +6
Reinforcement Learning from Human Feedback (RLHF) is currently the most widely used method to align large language models (LLMs) with human preferences. Existing RLHF methods can b…