1 paper
Jie Cheng, Gang Xiong, Xingyuan Dai +3
Preference-based Reinforcement Learning (PbRL) circumvents the need for reward engineering by harnessing human preferences as the reward signal. However, current PbRL methods exces…