1 paper · 1 filter
Wanqiao Xu, Shi Dong, Dilip Arumugam +1
A centerpiece of the ever-popular reinforcement learning from human feedback (RLHF) approach to fine-tuning autoregressive language models is the explicit training of a reward mode…