1 paper · 1 filter
Jiaming Cheng, Duong Tung Nguyen
Serving large language model (LLM) inference in cloud environments requires jointly optimizing model selection, GPU provisioning, parallelism configuration, and workload routing un…