6 papers
Registers Matter for Pixel-Space Diffusion Transformers
Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy +2
Vision Transformers (ViTs) are known to exhibit high-norm patch-token outliers that degrade feature map quality, a problem effectively mitigated by register tokens. As diffusion mo…
Revisiting Autoregressive Models for Generative Image Classification
Ilia Sudakov, Artem Babenko, Dmitry Baranchuk
Class-conditional generative models have emerged as accurate and robust classifiers, with diffusion models demonstrating clear advantages over other visual generative paradigms, in…
Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization
Mikhail Persiianov, Arip Asadulaev, Nikita Andreev +5
Learning conditional distributions is a central problem in machine learning, which is typically approached via supervised methods with paired data …
Scale-wise Distillation of Diffusion Models
Nikita Starodubcev, Ilya Drobyshevskiy, Denis Kuznedelev +2
Recent diffusion distillation methods have achieved remarkable progress, enabling high-quality -step sampling for large-scale text-conditional image and video diffusion mo…
Rethinking Global Text Conditioning in Diffusion Transformers
Nikita Starodubcev, Daniil Pakhomov, Zongze Wu +6
Diffusion transformers typically incorporate textual information via attention layers and a modulation mechanism using a pooled text embedding. Nevertheless, recent approaches disc…
Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps
Nikita Starodubcev, Mikhail Khoroshikh, Artem Babenko +1
Diffusion distillation represents a highly promising direction for achieving faithful text-to-image generation in a few sampling steps. However, despite recent successes, existing…