1 paper
Jun-Jie Yang, Chia-Heng Hsu, Kui-Yuan Chen +1
Preference-based reinforcement learning (PbRL) avoids explicit reward engineering by learning from pairwise human preference feedback. Existing offline PbRL methods typically follo…