5 papers
Rethinking Residual Errors in Compensation-based LLM Quantization
Shuaiting Li, Juncan Deng, Kedong Xu +5
Methods based on weight compensation, which iteratively apply quantization and weight compensation to minimize the output error, have recently demonstrated remarkable success in qu…
SSVQ: Unleashing the Potential of Vector Quantization with Sign-Splitting
Shuaiting Li, Juncan Deng, Chenxuan Wang +5
Vector Quantization (VQ) has emerged as a prominent weight compression technique, showcasing substantially lower quantization errors than uniform quantization across diverse models…
TMN: A Lightweight Neuron Model for Efficient Nonlinear Spike Representation
Yiwen Gu, Junchuan Gu, Haibin Shen +1
Spike trains serve as the primary medium for information transmission in Spiking Neural Networks, playing a crucial role in determining system efficiency. Existing encoding schemes…
Efficiency Meets Fidelity: A Novel Quantization Framework for Stable Diffusion
Shuaiting Li, Juncan Deng, Zeyu Wang +5
Text-to-image generation via Stable Diffusion models (SDM) have demonstrated remarkable capabilities. However, their computational intensity, particularly in the iterative denoisin…
MVQ:Towards Efficient DNN Compression and Acceleration with Masked Vector Quantization
Shuaiting Li, Chengxuan Wang, Juncan Deng +5
Vector quantization(VQ) is a hardware-friendly DNN compression method that can reduce the storage cost and weight-loading datawidth of hardware accelerators. However, conventional…