2 papers
cs.DC2026
ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters
Jiasheng Zhou, Longbin Zeng, Clavis Chen +5
Large-scale LLM training requires always-on, fine-grained observability for effective performance diagnosis at scale. Coarse resource monitors alone cannot localize root causes, an…
cs.OS2025
GoCkpt: Gradient-Assisted Multi-Step overlapped Checkpointing for Efficient LLM Training
Keyao Zhang, Yiquan Chen, Zhuo Hu +3
The accuracy of large language models (LLMs) improves with increasing model size, but increasing model complexity also poses significant challenges to training stability. Periodic…