1 paper
Yipin Guo, Yilin Lang, Qinyuan Ren
Due to their large size, generative Large Language Models (LLMs) require significant computing and storage resources. This paper introduces a new post-training quantization method,…