1 paper
Hejin Huang, Jusheng Zhang, Kaitong Cai +2
Preference-based alignment objectives have been widely adopted, from RLHF-style pairwise learning in large language models to emerging applications in recommender systems. Yet, exi…