1 paper · 1 filter
Pepijn de Reus, Ana Oprescu, Jelle Zuidema
This study examines quantisation and pruning strategies to reduce energy consumption in code Large Language Models (LLMs) inference. Using StarCoder2, we observe increased energy d…