7 papers
Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling
Wengyi Zhan, Chenqian Yan, Songwei Liu +2
Unified multimodal models jointly support understanding and generation, but incur substantial redundant computation across tokens, layers, and generation timesteps. Through token-i…
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
Wengyi Zhan, Mingbao Lin, Zhihang Lin +1
Multimodal large language models (MLLMs) deliver impressive vision-language reasoning but suffer steep inference latency because self-attention scales quadratically with sequence l…
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
Wengyi Zhan, Mingbao Lin, Shuicheng Yan +1
We introduce DiffusionTrend for virtual fashion try-on, which forgoes the need for retraining diffusion models. Using advanced diffusion models, DiffusionTrend harnesses latent inf…
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
Zhihang Lin, Mingbao Lin, Wengyi Zhan +1
Diffusion models suffer severe object repetition and local distortion when the inference resolution differs from its pre-trained resolution. We propose AccDiffusion v2, an accurate…
UniVST: A Unified Framework for Training-free Localized Video Style Transfer
Quanjian Song, Mingbao Lin, Wengyi Zhan +3
This paper presents UniVST, a unified framework for localized video style transfer based on diffusion models. It operates without the need for training, offering a distinct advanta…
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
Wengyi Zhan, Mingbao Lin, Chia-Wen Lin +1
In an effort to improve the efficiency and scalability of single-image super-resolution (SISR) applications, we introduce AnySR, to rebuild existing arbitrary-scale SR methods into…