1 paper
Heng Zhao, Zilei Shao, Guy Van den Broeck +1
Mixture-of-Experts (MoE) models scale by activating only a small subset of experts per token. However, training such models remains challenging because top-k routing is discrete…