1 paper
Juntao Zhao, Wenhao Lu, Sheng Wang +2
Quantization is widely adopted to accelerate inference and reduce memory consumption in large language models (LLMs). While activation-weight joint quantization enables efficient l…