2 papers
cs.AR2026
Decoupling Logical Masks from GPU Execution for Dynamic Block-Sparse Attention
Shanghao Liu, Xiaoyun Yu, Wanting Li +1
Attention computation makes inference expensive in video diffusion transformers (vDiTs), which generate videos through iterative denoising. Block-sparse attention (BSA) reduces thi…
cs.CV2026
SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference
Shanghao Liu, Renze Chen, Size Zheng +4
Video diffusion transformers (vDiTs) generate high quality but pay quadratic self-attention cost, making inference prohibitive at video-token scales. The challenge is input-adaptiv…