1 paper
Jing Li, Zhijie Sun, Dachao Lin +5
Mixture-of-Experts (MoE) architectures enable efficient scaling of large language models by activating only a subset of parameters per input. However, existing MoE models suffer fr…