1 paper
Tianhao Xu, Yiming Liu, Xianglong Lu +18
Optimizing Large Language Model (LLM) inference in production systems is increasingly difficult due to dynamic workloads, stringent latency/throughput targets, and a rapidly expand…