1 paper · 1 filter
Simona-Vasilica Oprea, Adela Bâra
Learning human preferences in language models remains fundamentally challenging, as reward modeling relies on subtle, subjective comparisons or shades of gray rather than clear-cut…