1 paper
Seongwon Yoon, Pin-Jun Chen, Shimeng Yu
The rapid scaling of large language models (LLMs), particularly mixture-of-experts (MoE) architectures, has intensified interconnect demands because expert-parallel execution is co…