1 paper
Bailey J. Eccles, Leon Wong, Blesson Varghese
Extensive compute and memory requirements limit the deployment of large language models (LLMs) on any hardware. Compression methods, such as pruning, can reduce model size, which i…