1 paper
Minghe Wang, Trever Schirmer, Mohammadreza Malekabbasi +1
Mixture-of-Experts (MoE) models offer high capacity with efficient inference cost by activating a small subset of expert models per input. However, deploying MoE models requires al…