1 paper
Nayeon Kim, Hojin Lee, Yunju Bak +2
Mixture-of-Experts (MoE) architectures significantly expand model capacity without a proportional increase in computational cost. However, optimizing their hyperparameters---partic…