1 paper · 1 filter
Yining Wang, Jinman Zhao, Chuangxin Zhao +3
Reinforcement Learning with Human Feedback (RLHF) has been the dominant approach for improving the reasoning capabilities of Large Language Models (LLMs). Recently, Reinforcement L…