gpu acceleration 1hardware-software co-design 1n:m sparsity 1sparse inference 1vision transformers 1
From the 1 of 2 linked papers with an AI index.
2 papers
cs.AR2026
Realizable N:M Sparse Transformer Inference via Search-Kernel Co-Design
Yiming Liu, Wenqi Lou, Zhiguang Wang +4
The paper presents a co-designed hardware and software framework that enables fast inference of Vision Transformers by applying N:M structured sparsity with a specialized CUDA kern…
cs.LG2026
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
Fengrui Zuo, Zhiwei Ke, Yiming Liu +3
Diffusion language models (DLMs) generate text through iterative denoising, but inference requires full-sequence attention at every iteration, resulting in substantial redundant co…