1 paper · 1 filter
Yan Li, Zhenyu Zhang, Zhengang Wang +2
Prevailing LLM serving engines employ expert parallelism (EP) to implement multi-device inference of massive MoE models. However, the efficiency of expert parallel inference is lar…