1 paper
Yulin Yuan, Hongshuo Zhao, Xiangming Meng
Diffusion-based multimodal large language models (dMLLMs) decode by iteratively predicting tokens at multiple masked positions in parallel. This turns each decoding step into a pos…