1 paper · 1 filter
Zongfang Liu, Jinghui Zhang, Zijian Ma +2
Mixture-of-Experts (MoE) language models reduce per-token computation through sparse expert activation, yet deployment still requires storing the full expert pool, making one-shot…