1 paper · 1 filter
Yansen Han, Shengyi Liao, Peng Sun +4
Preference alignment for flow and diffusion models now spans online reinforcement learning and offline preference optimization, but the relation between these methods remains uncle…