1 paper · 1 filter
Aadyot Bhatnagar, Peter Mørch Groth, Ali Madani
Large language models can be aligned with human preferences through offline reinforcement learning (RL) on small labeled datasets. While single-objective alignment is well-studied,…