4 citations
- Hong Kong University of Science and TechnologyHK3 papers
- Microsoft (United States)US3 papers
- Tsinghua UniversityCN3 papers
- Beijing Academy of Artificial IntelligenceCN2 papers
- Academy of Mathematics and Systems ScienceCN1 paper
- Chinese Academy of SciencesCN1 paper
- Communication University of ChinaCN1 paper
- Digital Science (United States)US1 paper
- Florida State UniversityUS1 paper
- Fudan UniversityCN1 paper
- Guizhou UniversityCN1 paper
- Korea Advanced Institute of Science and TechnologyKR1 paper
Showing cs.DCShow all
2 papers · 1 filter
cs.DC2026
Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design
Chunyu Xue, Weihao Cui, Quan Chen +10
Efficiently training large-scale models (LMs) in GPU clusters involves two separate avenues: inter-job dynamic scheduling and intra-job adaptive parallelism (AP). However, existing…
cs.DC2026★ 3 cited
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
Changho Hwang, Peng Cheng, Roshan Dathathri +12
AI applications increasingly run on fast-evolving, heterogeneous hardware to maximize performance, but general-purpose libraries lag in supporting these features. Performance-minde…