1 paper
Ni Mu, Yao Luan, Yiqin Yang +2
Preference-based reinforcement learning (PbRL) stands out by utilizing human preferences as a direct reward signal, eliminating the need for intricate reward engineering. However,…