1 paper · 1 filter
Ni Mu, Yao Luan, Yiqin Yang +2
Preference-based reinforcement learning (PbRL) stands out by utilizing human preferences as a direct reward signal, eliminating the need for intricate reward engineering. However,…