2 papers
cs.LG2026
Listwise Direct Preference Optimization with Multi-Dimensional Preference Mixing
Yuhui Sun, Xiyao Wang, Zixi Li +6
Recent alignment methods based on Direct Preference Optimization (DPO) reformulate preference learning as supervised optimization over pairwise comparisons, offering improved effic…
cs.CL2025
Role-Play Paradox in Large Language Models: Reasoning Performance Gains and Ethical Dilemmas
Jinman Zhao, Zifan Qian, Linbo Cao +5
Role-play in large language models (LLMs) enhances their ability to generate contextually relevant and high-quality responses by simulating diverse cognitive perspectives. However,…