6 papers
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
Wengyi Zhan, Mingbao Lin, Zhihang Lin +1
Multimodal large language models (MLLMs) deliver impressive vision-language reasoning but suffer steep inference latency because self-attention scales quadratically with sequence l…
UniVST: A Unified Framework for Training-free Localized Video Style Transfer
Quanjian Song, Mingbao Lin, Wengyi Zhan +3
This paper presents UniVST, a unified framework for localized video style transfer based on diffusion models. It operates without the need for training, offering a distinct advanta…
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
Zhihang Lin, Mingbao Lin, Wengyi Zhan +1
Diffusion models suffer severe object repetition and local distortion when the inference resolution differs from its pre-trained resolution. We propose AccDiffusion v2, an accurate…
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
Wengyi Zhan, Mingbao Lin, Shuicheng Yan +1
We introduce DiffusionTrend for virtual fashion try-on, which forgoes the need for retraining diffusion models. Using advanced diffusion models, DiffusionTrend harnesses latent inf…
AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource
Wengyi Zhan, Mingbao Lin, Chia-Wen Lin +1
In an effort to improve the efficiency and scalability of single-image super-resolution (SISR) applications, we introduce AnySR, to rebuild existing arbitrary-scale SR methods into…
CutDiffusion: A Simple, Fast, Cheap, and Strong Diffusion Extrapolation Method
Mingbao Lin, Zhihang Lin, Wengyi Zhan +2
Transforming large pre-trained low-resolution diffusion models to cater to higher-resolution demands, i.e., diffusion extrapolation, significantly improves diffusion adaptability.…