1 paper · 1 filter
Qi Wang, Hanyang Peng, Yue Yu
Mixture-of-Experts (MoE) models enable scalable performance by activating large parameter sets sparsely, minimizing computational overhead. To mitigate the prohibitive cost of trai…