1 paper · 1 filter
Bingxin Xu, Zhen Dong, Oussama Elachqar +1
Large language models require massive memory footprints, severely limiting deployment on consumer hardware. Quantization reduces memory through lower numerical precision, but extre…