1 paper · 1 filter
Mudit Verma, Katherine Metcalf
Preference based Reinforcement Learning (PbRL) removes the need to hand specify a reward function by learning a reward from preference feedback over policy behaviors. Current appro…