1 paper · 1 filter
Tianren Ma, Mu Zhang, Yibing Wang +1
Optimizing discrete diffusion model (DDM) with rewards remains a challenge: the non-autoregressive paradigm makes importance sampling intractable and rollout complex, puzzling rein…