1 paper
Jonathan Erskine, Taku Yamagata, Raúl Santos-Rodríguez
Preference-based reinforcement learning has gained prominence as a strategy for training agents in environments where the reward signal is difficult to specify or misaligned with h…