1 paper · 2 filters
X. Y. Han, Yuan Zhong
In large-scale AI training, Sparse Mixture-of-Experts (s-MoE) layers enable scaling by activating only a small subset of experts per token. An operational challenge in this design…