1 paper · 1 filter
Yingping Wang, Yi Wu, Xiangyu Wu +4
Mixture-of-Experts (MoE) architectures are widely used in modern large language models and multimodal models. However, inference efficiency is often limited by highly dynamic and s…