1 paper
Timo Kaufmann, Paul Weng, Viktor Bengs +1
Reinforcement learning from human feedback (RLHF) is a variant of reinforcement learning (RL) that learns from human feedback instead of relying on an engineered reward function. B…