1 paper · 1 filter
Heewoong Choi, Sangwon Jung, Hongjoon Ahn +1
In Reinforcement Learning (RL), designing precise reward functions remains to be a challenge, particularly when aligning with human intent. Preference-based RL (PbRL) was introduce…