1 paper · 1 filter
David Wu, Sanjiban Choudhury
Aligning large language models (LLMs) to human preferences is challenging in domains where preference data is unavailable. We address the problem of learning reward models for such…