1 paper · 1 filter
X. Y. Han, Yuan Zhong
In large-scale AI training, Sparse Mixture-of-Experts (s-MoE) layers enable scaling by activating only a small subset of experts per token. An operational challenge in this design…