1 paper · 1 filter
Eugene Kwek, Wenpeng Yin
Making large language models (LLMs) more efficient in memory, latency, and serving cost is crucial for edge deployment, interactive applications, and sustainable inference at scale…