1 paper · 1 filter
Kaihui Chen, Hao Yi, Qingyang Li +4
Enhancing the conformity of large language models (LLMs) to human preferences remains an ongoing research challenge. Recently, offline approaches such as Direct Preference Optimiza…