1 paper
Weibo Zhao, Yubin Shi, Xinyu Lyu +3
Quantization stands as a pivotal technique for large language model (LLM) serving, yet it poses significant challenges particularly in achieving effective low-bit quantization. The…