1 paper
Tianren Ma, Mu Zhang, Yibing Wang +1
Optimizing discrete diffusion model (DDM) with rewards remains a challenge: the non-autoregressive paradigm makes importance sampling intractable and rollout complex, puzzling rein…