2 papers
cs.DC2024
Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing
Yuxin Wang, Xueze Kang, Shaohuai Shi +8
To efficiently scale large model (LM) training, researchers transition from data parallelism (DP) to hybrid parallelism (HP) on GPU clusters, which frequently experience hardware a…
cs.NI2024
Low-Latency Video Conferencing via Optimized Packet Routing and Reordering
Yao Xiao, Sitian Chen, Amelie Chi Zhou +4
In the face of rising global demand for video meetings, managing traffic across geographically distributed (geo-distributed) data centers presents a significant challenge due to th…