1 paper · 1 filter
Xiao Liu, Lijun Zhang, Deepak Ganesan +1
Multi-device inference can reduce Transformer latency by parallelizing computation. However, existing methods require high inter-device bandwidth, making them impractical for bandw…