1 paper
Jiasheng Zhou, Longbin Zeng, Clavis Chen +5
Large-scale LLM training requires always-on, fine-grained observability for effective performance diagnosis at scale. Coarse resource monitors alone cannot localize root causes, an…