1 paper
Seongyoon Kim, Boryeong Cho, Jihwan Oh +2
Large language models are increasingly aligned to human preferences via reward modeling, but user preference data are sensitive and often cannot be centralized. Federated learning…