1 paper
Wenhao Zhan, Masatoshi Uehara, Wen Sun +1
Preference-based Reinforcement Learning (PbRL) is a paradigm in which an RL agent learns to optimize a task using pair-wise preference-based feedback over trajectories, rather than…