1 paper · 1 filter
Silviu Pitis, Ziang Xiao, Nicolas Le Roux +1
While finetuning language models from pairwise preferences has proven remarkably effective, the underspecified nature of natural language presents critical challenges. Direct prefe…