1 paper
Yifang Chen, Shuohang Wang, Ziyi Yang +6
Reinforcement learning with human feedback (RLHF), as a widely adopted approach in current large language model pipelines, is \textit{bottlenecked by the size of human preference d…