1 paper
Qiao Li, Xiaomeng Fu, Yuanshu Zhao +3
Multimodal Diffusion Transformers (MM-DiTs) have demonstrated remarkable text-to-image generation performance, surpassing traditional U-Net-based diffusion models. Nevertheless, th…