1 paper
Xiaolong Tu, Vinod K. Mishra, Venkat R. Dasari +2
Accurate latency prediction is critical for deploying large language models (LLMs) on heterogeneous edge devices, where inference latency is affected by model architecture, prompt…