1 paper · 1 filter
Achille Jacquemond, Yuma Ichikawa, Akira Sakai
Compressing large language models to two bits or fewer is increasingly feasible through block-wise post-training quantization; cross-block variants reconstruct neighboring Transfor…