1 paper
Shun Usami, Venkatram Vishwanath, E. Wes Bethel
As large language models (LLMs) are increasingly deployed in latency- and cost-sensitive settings, inference efficiency has become a central systems challenge. While GPUs dominate…