1 paper
Wanqian Li, Jintao Peng, Zongfei Jing +7
Large language model (LLM) inference increasingly depends on multi-GPU execution, yet existing inference parallelization strategies require layer-wise inter-rank synchronization, m…