1 paper
Yixian Xu, Yuanrui Zhang, Shengjie Luo +2
Reinforcement learning (RL) post-training provides a direct way to align diffusion models with human preferences and task-specific rewards. However, current RL algorithms for diffu…