1 paper
Tony Tu, Sayan Chakraborty, Ruomeng Xu +2
Aligning a language agent to several objectives at once is a persistent failure mode of preference-based training: when objectives are combined additively, optimization collapses o…