1 paper
Eunjeong Kim, Yeong Jun Jeon, Myeonggyun Han
Speculative decoding accelerates autoregressive large language model (LLM) inference by using a lightweight draft model to speculate multiple tokens, reducing expensive target mode…