1 paper
Fengshuo Bai, Rui Zhao, Hongming Zhang +5
Preference-based reinforcement learning (PbRL) has shown impressive capabilities in training agents without reward engineering. However, a notable limitation of PbRL is its depende…