1 paper
Songjun Tu, Jingbo Sun, Qichao Zhang +4
Offline preference-based reinforcement learning (PbRL) typically operates in two phases: first, use human preferences to learn a reward model and annotate rewards for a reward-free…