Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
TS-Memory: Plug-and-Play Memory for Time Series Foundation Models
Sisuo Lyu, Siru Zhong, Tiegang Chen +6
Time Series Foundation Models (TSFMs) achieve strong zero-shot forecasting through large-scale pre-training, but adapting them to downstream domains under distribution shift remain…
cs.LG2018
Highly Scalable Deep Learning Training System with Mixed-Precision: Training ImageNet in Four Minutes
Xianyan Jia, Shutao Song, Wei He +11
Synchronized stochastic gradient descent (SGD) optimizers with data parallelism are widely used in training large-scale deep neural networks. Although using larger mini-batch sizes…