1 paper
Faraz Tahmasebi, Yian Wang, Benji Y. H. Huang +1
Recent research has shown that large language models (LLMs) can utilize low-precision floating point (FP) quantization to deliver high efficiency while maintaining original model a…