1 paper · 1 filter
Zhixian Xie, Haode Zhang, Yizhe Feng +1
Reward design in reinforcement learning and optimal control is challenging. Preference-based alignment addresses this by enabling agents to learn rewards from ranked trajectory pai…