1 paper
Ruiyao Xu, Mihir Parmar, Tiankai Yang +3
Learning from preference-based feedback has become an effective approach for aligning LLMs across diverse tasks. However, high-quality human-annotated preference data remains expen…