1 paper · 1 filter
Dinesh Gopalan, Ratul Ali
Scaling distributed GPU training is commonly assumed to yield predictable performance gains as additional nodes are added. In practice, many large-scale deployments encounter dimin…