1 paper · 1 filter
Vincent Dumoulin, Daniel D. Johnson, Pablo Samuel Castro +2
Learning from human feedback (LHF) -- and in particular learning from pairwise preferences -- has recently become a crucial ingredient in training large language models (LLMs), and…