171 citations · 204 across the 18 of their papers we have counts for
10 papers · 1 filter
SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention
Qi Zhao, Qirui Li, Hanlin Tang +10
Diffusion Transformers (DiTs) incur quadratic self-attention cost over spatiotemporal tokens. Existing training-free sparse attention methods often construct sparse masks from bloc…
Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
Maohua Li, Qirui Li, Yanke Zhou +10
Modern text-to-image diffusion transformers (DiTs) generate images through joint attention, in which text and image tokens interact directly within a single sequence. In large-scal…
Rethinking Cross-Layer Information Routing in Diffusion Transformers
Chao Xu, Maohua Li, Qirui Li +9
Diffusion Transformers (DiTs) have become a de facto backbone of modern visual generation, and nearly every major axis of their design -- tokenization, attention, conditioning, obj…
Mimic The Raw Domain: Accelerating Action Recognition in the Compressed Domain
Barak Battash, Haim Barad, Hanlin Tang +1
Video understanding usually requires expensive computation that prohibits its deployment, yet videos contain significant spatiotemporal redundancy that can be exploited. In particu…
Using Image Priors to Improve Scene Understanding
Brigit Schroeder, Hanlin Tang, Alexandre Alahi
Semantic segmentation algorithms that can robustly segment objects across multiple camera viewpoints are crucial for assuring navigation and safety in emerging applications such as…
Triplet-Aware Scene Graph Embeddings
Brigit Schroeder, Subarna Tripathi, Hanlin Tang
Scene graphs have become an important form of structured knowledge for tasks such as for image generation, visual relation detection, visual question answering, and image retrieval…