1 paper
Ryan Tomich, Zhizhen Zhong, Dirk Englund
The growing demand for low-latency, energy-efficient inference in large language models (LLMs) has catalyzed interest in heterogeneous architectures. While GPUs remain dominant, th…