1 paper
Gabriele Tombesi, William Baisi, Je Yang +5
LLM inference on edge devices is constrained by computational and memory resources, making efficient autoregressive decoding challenging. Speculative decoding alleviates this bottl…