1 paper
Miles Williams, George Chrysostomou, Nikolaos Aletras
Quantization and pruning are fundamental approaches for model compression, enabling efficient inference for language models. In a post-training setting, state-of-the-art quantizati…