1 paper · 1 filter
Taneesh Gupta, Shivam Shandilya, Xuchao Zhang +5
Reward modeling in large language models is susceptible to reward hacking, causing models to latch onto superficial features such as the tendency to generate lists or unnecessarily…