1 paper · 1 filter
Deep Pankajbhai Mehta
Training large language models requires distributing computation across many accelerators, yet practitioners select parallelism strategies (data, tensor, pipeline, ZeRO) through tr…