1 paper
Xun Fang, Yunchen Li, Hang Yuan +1
Discrete diffusion language models improve generation efficiency through parallel token prediction, but standard X0 prediction methods introduce factorization errors by approxim…