1 paper · 1 filter
Jiamu Bai, Xin Yu, Meilong Xu +6
Reinforcement learning from human feedback (RLHF) has proven effectiveness for aligning text-to-image (T2I) diffusion models with human preferences. Although Direct Preference Opti…