1 paper
Saeed Khaki, JinJin Li, Lan Ma +2
Reinforcement learning from human feedback (RLHF) has been extensively employed to align large language models with user intent. However, proximal policy optimization (PPO) based R…