collaborators

6 papers

cs.CV2025

Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference

Wengyi Zhan, Mingbao Lin, Zhihang Lin +1

Multimodal large language models (MLLMs) deliver impressive vision-language reasoning but suffer steep inference latency because self-attention scales quadratically with sequence l…

cs.CV2025

UniVST: A Unified Framework for Training-free Localized Video Style Transfer

Quanjian Song, Mingbao Lin, Wengyi Zhan +3

This paper presents UniVST, a unified framework for localized video style transfer based on diffusion models. It operates without the need for training, offering a distinct advanta…

cs.CV2025

AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation

Zhihang Lin, Mingbao Lin, Wengyi Zhan +1

Diffusion models suffer severe object repetition and local distortion when the inference resolution differs from its pre-trained resolution. We propose AccDiffusion v2, an accurate…

cs.CV2025

DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On

Wengyi Zhan, Mingbao Lin, Shuicheng Yan +1

We introduce DiffusionTrend for virtual fashion try-on, which forgoes the need for retraining diffusion models. Using advanced diffusion models, DiffusionTrend harnesses latent inf…

cs.CV2024

AnySR: Realizing Image Super-Resolution as Any-Scale, Any-Resource

Wengyi Zhan, Mingbao Lin, Chia-Wen Lin +1

In an effort to improve the efficiency and scalability of single-image super-resolution (SISR) applications, we introduce AnySR, to rebuild existing arbitrary-scale SR methods into…

cs.CV2024

CutDiffusion: A Simple, Fast, Cheap, and Strong Diffusion Extrapolation Method

Mingbao Lin, Zhihang Lin, Wengyi Zhan +2

Transforming large pre-trained low-resolution diffusion models to cater to higher-resolution demands, i.e., diffusion extrapolation, significantly improves diffusion adaptability.…