7 papers · 1 filter
FraQAT: Quantization Aware Training with Fractional bits
Luca Morreale, Alberto Gil C. P. Ramos, Malcolm Chadwick +4
State-of-the-art (SOTA) generative models have demonstrated impressive capabilities in image synthesis or text generation, often with a large capacity model. However, these large m…
Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
Young D. Kwon, Abhinav Mehrotra, Malcolm Chadwick +2
High-resolution (4K) image-to-image synthesis has become increasingly important for mobile applications. Existing diffusion models for image editing face significant challenges, in…
HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
Young D. Kwon, Rui Li, Sijia Li +3
State-of-the-art text-to-image diffusion models (DMs) achieve remarkable quality, yet their massive parameter scale (8-11B) poses significant challenges for inferences on resource-…
Guidance Free Image Editing via Explicit Conditioning
Mehdi Noroozi, Alberto Gil Ramos, Luca Morreale +4
Current sampling mechanisms for conditional diffusion models rely mainly on Classifier Free Guidance (CFG) to generate high-quality images. However, CFG requires several denoising…
Upcycling Text-to-Image Diffusion Models for Multi-Task Capabilities
Ruchika Chavhan, Abhinav Mehrotra, Malcolm Chadwick +4
Text-to-image synthesis has witnessed remarkable advancements in recent years. Many attempts have been made to adopt text-to-image models to support multiple tasks. However, existi…
EDiT: Efficient Diffusion Transformers with Linear Compressed Attention
Philipp Becker, Abhinav Mehrotra, Ruchika Chavhan +5
Diffusion Transformers (DiTs) have emerged as a leading architecture for text-to-image synthesis, producing high-quality and photorealistic images. However, the quadratic scaling p…