1 paper
Xuran Liu, Nan Xue, Rui Bao +5
While deploying large language models on edge devices promises low-latency and privacy-preserving AI services, it is hindered by limited device resources. Although pipeline paralle…