1 paper
Jihyun Lim, Junhyuk Jo, Chanhyeok Ko +3
Most parallel neural network training methods assume homogeneous computing resources. For example, synchronous data-parallel SGD suffers from significant synchronization overhead u…