1 paper · 1 filter
Yaojie Shen, Xinyao Wang, Yulei Niu +5
Preference Optimization (PO), is gaining popularity as an alternative choice of Proximal Policy Optimization (PPO) for aligning Large Language Models (LLMs). Recent research on ali…