1 paper
Qingyue Wang, Qi Pang, Xixun Lin +2
Mixture-of-Experts (MoE) have emerged as a powerful architecture for large language models (LLMs), enabling efficient scaling of model capacity while maintaining manageable computa…