1 paper · 1 filter
Daniel Scalena, Gabriele Sarti, Malvina Nissim +1
Due to language models' propensity to generate toxic or hateful responses, several techniques were developed to align model generations with users' preferences. Despite the effecti…