1 paper
Anukriti Singh, Amisha Bhaskar, Peihong Yu +4
Designing reward functions for continuous-control robotics often leads to subtle misalignments or reward hacking, especially in complex tasks. Preference-based RL mitigates some of…