2 papers
cs.CV2026
SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention
Qi Zhao, Qirui Li, Hanlin Tang +10
Diffusion Transformers (DiTs) incur quadratic self-attention cost over spatiotemporal tokens. Existing training-free sparse attention methods often construct sparse masks from bloc…
cs.CV2025
Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation
Qirui Li, Guangcong Zheng, Qi Zhao +4
The computational demands of self-attention mechanisms pose a critical challenge for transformer-based video generation, particularly in synthesizing ultra-long sequences. Current…