2 papers
cs.CV2024
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
Hao Li, Shamit Lal, Zhiheng Li +9
We empirically study the scaling properties of various Diffusion Transformers (DiTs) for text-to-image generation by performing extensive and rigorous ablations, including training…
cs.CV2024
BodyMetric: Evaluating the Realism of Human Bodies in Text-to-Image Generation
Nefeli Andreou, Varsha Vivek, Ying Wang +5
Accurately generating images of human bodies from text remains a challenging problem for state of the art text-to-image models. Commonly observed body-related artifacts include ext…