1 paper · 1 filter
Kaiyang Guo, Yinchuan Li, Zhitang Chen
Direct alignment methods typically train large language models (LLMs) by contrasting the likelihoods of preferred and dispreferred responses. While effective at capturing relative…