1 paper · 1 filter
Jingcong Liang, Siyuan Wang, Miren Tian +3
Mixture-of-Experts (MoE) enables efficient scaling of large language models (LLMs) with sparsely activated experts during inference. To effectively deploy large MoE models on memor…