1 paper · 1 filter
Hritik Bansal, Ashima Suvarna, Gantavya Bhatt +3
A common technique for aligning large language models (LLMs) relies on acquiring human preferences by comparing multiple generations conditioned on a fixed context. This method, ho…