23 citations · 25 across the 6 of their papers we have counts for
1 paper · 2 filters
Chuheng Zhang, Wei Shen, Li Zhao +4
While direct policy optimization methods exist, pioneering LLMs are fine-tuned with reinforcement learning from human feedback (RLHF) to generate better responses under the supervi…