1 paper · 1 filter
Audrey Huang, Wenhao Zhan, Tengyang Xie +4
Language model alignment methods such as reinforcement learning from human feedback (RLHF) have led to impressive advances in language model capabilities, but are limited by a wide…