1 paper · 1 filter
Minjune Hwang, Yigit Korkmaz, Daniel Seita +1
Preference-based reward learning is widely used for shaping agent behavior to match a user's preference, yet its sparse binary feedback makes it especially vulnerable to causal con…