1 citations · 1 across the 1 of their papers we have counts for
1 paper · 1 filter
Jing Li, Zhijie Sun, Dachao Lin +5
Mixture-of-Experts (MoE) architectures enable efficient scaling of large language models by activating only a subset of parameters per input. However, existing MoE models suffer fr…