1 paper
Xianyan Jia, Shutao Song, Wei He +11
Synchronized stochastic gradient descent (SGD) optimizers with data parallelism are widely used in training large-scale deep neural networks. Although using larger mini-batch sizes…