1 paper
Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski +2
Text-to-image (T2I) models contain rich spatial priors. Synthesizing photorealistic, cluttered scenes requires an understanding of geometry, including perspective and relative scal…