1 paper · 1 filter
Muyoung Son, Yi Chen, Seungjae Yoo +2
The Mixture-of-Experts (MoE) architecture improves computational efficiency via sparse expert activation, but throughput-oriented inference faces substantial GPU memory pressure du…