1 paper
Atul Kumar Sinha, François Fleuret
We introduce a fast low-rank factorization-based framework for compressing large language models that enables rapid compression of billion-parameter models without retraining. Unli…