1 paper
Xiangyu Ma, Teng Xiao, Zuchao Li +1
Diffusion models promise efficient parallel text generation but rely on bidirectional attention, creating a structural mismatch with pre-trained Autoregressive (AR) models. This in…