collaborators

7 papers

cs.CV2025

SpotEdit: Selective Region Editing in Diffusion Transformers

Zhibin Qin, Zhenxiong Tan, Zeqing Wang +2

Diffusion Transformer models have significantly advanced image editing by encoding conditional images and integrating them into transformer layers. However, most edits involve modi…

cs.CV2025

Vision Bridge Transformer at Scale

Zhenxiong Tan, Zeqing Wang, Xingyi Yang +2

We introduce Vision Bridge Transformer (ViBT), a large-scale instantiation of Brownian Bridge Models designed for conditional generation. Unlike traditional diffusion models that t…

cs.CV2025

Image Editing As Programs with Diffusion Models

Yujia Hu, Songhua Liu, Zhenxiong Tan +2

While diffusion models have achieved remarkable success in text-to-image generation, they encounter significant challenges with instruction-driven image editing. Our research highl…

cs.CV2025

Ultra-Resolution Adaptation with Ease

Ruonan Yu, Songhua Liu, Zhenxiong Tan +1

Text-to-image diffusion models have achieved remarkable progress in recent years. However, training models for high-resolution image generation remains challenging, particularly wh…

cs.CV2025

OminiControl2: Efficient Conditioning for Diffusion Transformers

Zhenxiong Tan, Qiaochu Xue, Xingyi Yang +2

Fine-grained control of text-to-image diffusion transformer models (DiT) remains a critical challenge for practical deployment. While recent advances such as OminiControl and other…

cs.CV2024

CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up

Songhua Liu, Zhenxiong Tan, Xinchao Wang

Diffusion Transformers (DiT) have become a leading architecture in image generation. However, the quadratic complexity of attention mechanisms, which are responsible for modeling t…