1 paper · 1 filter
Nayeon Kim, Hojin Lee, Yunju Bak +2
Mixture-of-Experts (MoE) architectures significantly expand model capacity without a proportional increase in computational cost. However, optimizing their hyperparameters---partic…