1 paper
Zhixian Xie, Haode Zhang, Yizhe Feng +1
Reward design in reinforcement learning and optimal control is challenging. Preference-based alignment addresses this by enabling agents to learn rewards from ranked trajectory pai…