2 papers
cs.DC2026
SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions
Feiyang Chen, Haibo Chen
Modern CPUs increasingly integrate matrix extensions, such as Arm Scalable Matrix Extension (SME), that provide high-throughput matrix execution within the CPU. For LLM inference,…
cs.DC2026
CoAgent: Concurrency Control for Multi-Agent Systems
Hongtao Lyu, Dingyan Zhang, Mingyu Wu +2
Multi-agent LLM systems -- coding agents, devops agents, document agents -- now routinely run several agents in parallel against the same git tree, Kubernetes cluster, or document.…