1 paper
Ravi Ghadia, Maksim Abraham, Sergei Vorobyov +1
Efficiently processing long sequences with Transformer models usually requires splitting the computations across accelerators via context parallelism. The dominant approaches in th…