4 papers
SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation
Xu Zhang, Yu Lu, Ruijie Quan +3
Flow Matching has enabled robust text-to-video generation via latent ODE sampling. However, velocity approximation and numerical discretization errors inevitably accumulate, causin…
Sortblock: Similarity-Aware Feature Reuse for Diffusion Model
Hanqi Chen, Xu Zhang, Xiaoliu Guan +4
Diffusion Transformers (DiTs) have demonstrated remarkable generative capabilities, particularly benefiting from Transformer architectures that enhance visual and artistic fidelity…
Forecasting When to Forecast: Accelerating Diffusion Models with Confidence-Gated Taylor
Xiaoliu Guan, Lielin Jiang, Hanqi Chen +6
Diffusion Transformers (DiTs) have demonstrated remarkable performance in visual generation tasks. However, their low inference speed limits their deployment in low-resource applic…
Enabling Versatile Controls for Video Diffusion Models
Xu Zhang, Hao Zhou, Haoming Qin +5
Despite substantial progress in text-to-video generation, achieving precise and flexible control over fine-grained spatiotemporal attributes remains a significant unresolved challe…