1 paper
Qi Zhao, Qirui Li, Hanlin Tang +10
Diffusion Transformers (DiTs) incur quadratic self-attention cost over spatiotemporal tokens. Existing training-free sparse attention methods often construct sparse masks from bloc…