1 paper
Ziang Liu, Junjie Xu, Xingjiao Wu +2
Preference-Based reinforcement learning (PBRL) learns directly from the preferences of human teachers regarding agent behaviors without needing meticulously designed reward functio…