1 paper
Devin Kwok, Gül Sena AltıntaÅ, Colin Raffel +1
Neural network training is inherently sensitive to initialization and the randomness induced by stochastic gradient descent. However, it is unclear to what extent such effects lead…