1 paper · 1 filter
Qi Zhang, Dawei Wang, Shaofeng Zou
Reinforcement learning (RL) has emerged as a powerful tool for aligning diffusion models with human preferences, typically by optimizing a single reward function under a KL regular…