1 paper
Yunqi Xue, Zhijiang Li, Philip Torr +1
Unlike diffusion-based models that operate in continuous latent spaces, autoregressive unified multimodal models produce images by sequentially predicting discretized visual tokens…