1 paper
Gokulakannan Sakthivel, Jerry Wu, Amogh Rajendra +1
Mixture-of-Experts (MoE) models route each token to a few of many expert networks, and that routing is data-dependent in a way standard inference optimizations do not expect. This…