1 paper · 1 filter
Marco Kurzynski, Shaizeen Aga, Di Wu
Training large language models (LLMs) efficiently requires a deep understanding of how modern GPU systems behave under real-world distributed training workloads. While prior work h…