1 paper · 1 filter
Yuzi Yan, Yibo Miao, Jialian Li +4
Aligning large language models (LLMs) with human preferences has gained significant attention, with Proximal Policy Optimization (PPO) as a standard yet computationally expensive m…