From the 5 of 91 papers with an AI index.
17 citations
- Tsinghua UniversityCN40 papers
- Peking UniversityCN37 papers
- Institute of Modern PhysicsCN36 papers
- Carnegie Mellon UniversityUS34 papers
- Istituto Nazionale di Fisica Nucleare, Laboratori Nazionali di FrascatiIT34 papers
- Istituto Nazionale di Fisica Nucleare, Sezione di PerugiaIT34 papers
- Nanjing Normal UniversityCN34 papers
- National Centre for Nuclear ResearchPL34 papers
- South China Normal UniversityCN34 papers
- Università degli Studi del Piemonte Orientale “Amedeo Avogadro”IT34 papers
- University of BristolGB34 papers
- University of PerugiaIT34 papers
4 papers · 1 filter
Collective Communication for Distributed LLM Systems: Planning, Runtime Adaptation, and Computation Coordination
Xuebin Song, Menghao Zhang, Yuezheng Liu +5
Distributed large language model (LLM) systems increasingly rely on collective communication primitives such as AllReduce (AR), ReduceScatter (RS), AllGather (AG), and AlltoAll (A2…
SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving
Yihui Zhang, Tianyu Wo, Jinghao Wang +7
As LLM agents increasingly rely on the Model Context Protocol (MCP) to invoke isolated external sandboxes, disaggregated sandbox deployment introduces a fundamental tension between…
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
Mingjun Zhang, Xiaohe Hu, Menghao Zhang +21
Large-scale LLM training requires collective communication libraries to exchange data among distributed GPUs. As a company dedicated to building and operating large-scale GPU train…
CB-SpMV:A Data Aggregating and Balance Algorithm for Cache-Friendly Block-Based SpMV on GPUs
Xing Cong, Fukai Sun, Yifan Chen +3
Sparse matrix-vector multiplication (SpMV) is crucial in computational science, engineering, and machine learning. Despite substantial efforts to improve SpMV performance on GPUs t…