1 paper
Zhiyao Xu, Aoxue Liu, Zhanjie Ding +3
Sparsely activated Mixture-of-Experts (MoE) models scale capacity via conditional computation, but distributed inference suffers from cross-GPU expert communication and routing-ind…