Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Ordered Local Momentum for Asynchronous Distributed Learning under Arbitrary Delays
Chang-Wei Shi, Shi-Shang Wang, Wu-Jun Li
Momentum SGD (MSGD) serves as a foundational optimizer in training deep models due to momentum's key role in accelerating convergence and enhancing generalization. Meanwhile, async…
cs.LG2025
Ordered Momentum for Asynchronous SGD
Chang-Wei Shi, Yi-Rui Yang, Wu-Jun Li
Distributed learning is essential for training large-scale deep models. Asynchronous SGD (ASGD) and its variants are commonly used distributed learning methods, particularly in sce…