1 paper · 1 filter
Ruipeng Jia, Yunyi Yang, Wen Wang +7
Scalar reward models compress multi-dimensional human preferences into a single opaque score, creating an information bottleneck that often leads to brittleness and reward hacking…