1 paper · 1 filter
Qiao Li, Xiaomeng Fu, Yuanshu Zhao +3
Multimodal Diffusion Transformers (MM-DiTs) have demonstrated remarkable text-to-image generation performance, surpassing traditional U-Net-based diffusion models. Nevertheless, th…