1 paper
Zimeng Li, Mudit Gaur, Vaneet Aggarwal
We study online alignment of large language models under misspecified preference feedback, where the observed preference oracle deviates from an ideal but unknown ground-truth orac…