1 paper
Nan Xue, Shengkang Chen, Zhiyong Chen +4
As large language models (LLMs) move from centralized clouds to mobile edge environments, efficient serving must balance latency, energy consumption, and accuracy under constrained…