collaborators

5 papers

cs.CL2025

DPad: Efficient Diffusion Language Models with Suffix Dropout

Xinhua Chen, Sitao Huang, Cong Guo +5

Diffusion-based Large Language Models (dLLMs) parallelize text generation by framing decoding as a denoising process, but suffer from high computational overhead since they predict…

cs.AR2025

Phi: Leveraging Pattern-based Hierarchical Sparsity for High-Efficiency Spiking Neural Networks

Chiyue Wei, Bowen Duan, Cong Guo +4

Spiking Neural Networks (SNNs) are gaining attention for their energy efficiency and biological plausibility, utilizing 0-1 activation sparsity through spike-driven computation. Wh…

cs.AR2025

Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression

Feng Cheng, Cong Guo, Chiyue Wei +7

Large language models (LLMs) have demonstrated transformative capabilities across diverse artificial intelligence applications, yet their deployment is hindered by substantial memo…

cs.AR2025

Transitive Array: An Efficient GEMM Accelerator with Result Reuse

Cong Guo, Chiyue Wei, Jiaming Tang +4

Deep Neural Networks (DNNs) and Large Language Models (LLMs) have revolutionized artificial intelligence, yet their deployment faces significant memory and computational challenges…

cs.AR2025

Prosperity: Accelerating Spiking Neural Networks via Product Sparsity

Chiyue Wei, Cong Guo, Feng Cheng +4

Spiking Neural Networks (SNNs) are highly efficient due to their spike-based activation, which inherently produces bit-sparse computation patterns. Existing hardware implementation…