Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs
Afsara Benazir, Chen Chen, Rongxiao Qu +3
Mixture-of-Experts (MoE) LLMs scale model capacity efficiently through sparse activation, but their large expert parameter footprint, routing imbalance, and long-context KV-cache g…
cs.LG2026
Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs
Afsara Benazir, Felix Xiaozhu Lin
Apple Neural Engine (ANE) is a dedicated neural processing unit (NPU) present in every Apple Silicon chip. Mixture-of-Experts (MoE) LLMs improve inference efficiency via sparse act…