1 paper
Ziyi Chen, Junyi Li, Peiran Yu +1
Reinforcement learning from human feedback (RLHF) and direct preference optimization (DPO) are important techniques to align large language models (LLM) with human preference. Howe…