1 paper
Leonidas Gee, Andrea Zugarini, Novi Quadrianto
To reduce the inference cost of large language models, model compression is increasingly used to create smaller scalable models. However, little is known about their robustness to…