2 citations · 3 across the 5 of their papers we have counts for
1 paper · 1 filter
Esmail Gumaan
Training multi-billion to trillion-parameter language models efficiently on GPU clusters requires leveraging multiple parallelism strategies. We present Galvatron, a novel open-sou…