1 paper
Abhinaba Basu, Kumkum Basu, Koushik Deb
Compressing transformer weights makes large language models cheaper to deploy. But each layer's compression introduces an error. These errors accumulate as the signal passes throug…