1 paper · 1 filter
Ravi Ghadia, Maksim Abraham, Sergei Vorobyov +1
Efficiently processing long sequences with Transformer models usually requires splitting the computations across accelerators via context parallelism. The dominant approaches in th…