1 paper · 1 filter
Ahmet Caner Yüzügüler, Jiawei Zhuang, Lukas Cavigelli
Large language models (LLMs) are typically served from clusters of GPUs/NPUs that consist of large number of devices. Unfortunately, communication between these devices incurs sign…