1 paper
Xiannan Hu, Tianyou Zeng, Xiaoming Yuan +3
Serving large language models (LLMs) to millions of users requires efficient resource allocation and parallelism strategies. It is a labor intensive trial-and-error process to find…