1 paper · 1 filter
Xu Bai, Muhammed Tawfiqul Islam, Chen Wang +1
Pipeline parallelism (PP) is widely used to partition layers of large language models (LLMs) across GPUs, enabling scalable inference for large models. However, existing systems re…