1 paper
Dang Nguyen, Wenhan Yang, Rathul Anand +2
Training with larger mini-batches improves the convergence rate and can yield superior performance. However, training with large mini-batches becomes prohibitive for Large Language…