1 paper · 1 filter
Binxu Wang, Jingxuan Fan, Xu Pan
Diffusion Transformers (DiTs) have greatly advanced text-to-image generation, but models still struggle to generate the correct spatial relations between objects as specified in th…