2 papers
cs.PF2026
SysOM-AI: Continuous Cross-Layer Performance Diagnosis for Production AI Training
Yusheng Zheng, Wenan Mao, Shuyi Cheng +8
Performance diagnosis in production-scale AI training is challenging because subtle OS-level issues can trigger cascading GPU delays and network slowdowns, degrading training effic…
cs.DC2026
Comprehensive Deadlock Prevention for GPU Collective Communication
Lichen Pan, Juncheng Liu, Yongquan Fu +4
Distributed deep neural network training necessitates efficient GPU collective communications, which are inherently susceptible to deadlocks. GPU collective deadlocks arise easily…