1 paper
Yihao Zhao, Jiadun Chen, Peng Sun +3
Large language models (LLMs) with different architectures and sizes have been developed. Serving each LLM with dedicated GPUs leads to resource waste and service inefficiency due t…