1 paper
Ni Mu, Hao Hu, Xiao Hu +3
Preference-based reinforcement learning (PbRL) bypasses explicit reward engineering by inferring reward functions from human preference comparisons, enabling better alignment with…