1 paper
Xuheng Li, Yihe Deng, Jingfeng Wu +2
Accelerated stochastic gradient descent (ASGD) is a workhorse in deep learning and often achieves better generalization performance than SGD. However, existing optimization theory…