1 paper · 1 filter
Qingyu Meng, Yiwei Zha, Jiahuan Pei +3
Mixture-of-Experts (MoE) is a scaling architecture for large language models that activates only a small subset of expert modules per token, enabling massive parameter growth with…