1 paper
Ali Janati, Kaoutar El Maghraoui, Xinyi Luo +3
Mixture-of-Experts (MoE) models decouple total parameters from per-token compute, but deployment still requires storing every expert. Recent theory shows that pruning experts with…