1 paper · 1 filter
Daniel Halpern, Evi Micha, Ariel D. Procaccia +3
Alignment from human feedback uses human judgments about model outputs to steer the behavior of language models after pretraining. When those judgments reflect conflicting views of…