1 paper
Heewoong Choi, Sangwon Jung, Hongjoon Ahn +1
In Reinforcement Learning (RL), designing precise reward functions remains to be a challenge, particularly when aligning with human intent. Preference-based RL (PbRL) was introduce…