1 paper
Gabriele Oliaro, Zhihao Jia, Daniel Campos +1
Speculative decoding is widely adopted to reduce latency in large language model (LLM) inference by leveraging smaller draft models capable of handling diverse user tasks. However,…