1 paper
Wenxin Wang, Yule Hou, Yu Ji +2
Local deployment of large Mixture-of-Experts (MoE) models falls short of the service quality achieved in cloud-scale environments, even under low-concurrency workloads. We identify…