1 paper
Pengfei Chen, Yize Wu, Shouxu Kuang +2
Load imbalance poses a major bottleneck to the efficiency of expert parallelism in distributed inference of Mixture-of-Experts (MoE) models. The most heavily loaded rank stalls glo…