1 paper
Jan Kompatscher, Danqing Shi, Giovanna Varni +2
Reinforcement learning from human feedback (RLHF) has emerged as a key enabling technology for aligning AI behaviour with human preferences. The traditional way to collect data in…