1 paper
Chengao Li, Hanyu Zhang, Yunkun Xu +3
Reinforcement Learning from Human Feedback (RLHF) has emerged as a powerful technique for aligning large language models (LLMs) with human preferences. However, effectively alignin…