1 paper · 1 filter
Can Hankendi, Rana Shahout, Minlan Yu +1
Large language model (LLM) inference has become a dominant workload in modern data centers, driving significant GPU utilization and energy consumption. While prior systems optimize…