1 paper
Yuchen Bao, Chao Wen, Haowei Wang +10
Reward post-training of diffusion generators inevitably concentrates probability mass on a few reward-favored modes, a mode collapse that erases within-prompt diversity. Existing m…