1 citations · 1 across the 12 of their papers we have counts for
1 paper · 1 filter
Ziyan Gan, Fangxin Liu, Chenyang Guan +10
Mixture-of-Experts (MoE) architectures scale Large Language Model (LLM) capacity efficiently by activating a sparse subset of experts per token. However, modern MoE inference remai…