1 paper · 1 filter
Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1
Mixture-of-Experts (MoE) is a popular class of large language models (LLMs), offering high efficiency and accuracy. However, in KV-cache-intensive serving scenarios, MoEs often exh…