1 paper
Fengze Yu, Leshu Li, Brad McDanel +1
Large language model (LLM) inference often suffers from high decoding latency and limited scalability across heterogeneous edge-cloud environments. Existing speculative decoding (S…