1 paper
Xingyu Hu, Kai Zhang, Jiancan Wu +7
In large language model (LLM)-based recommendation systems, direct preference optimization (DPO) effectively aligns recommendations with user preferences, requiring multi-negative…