1 paper
Jie Jiang, Xing Sun, Ruotian Chen +2
Speculative decoding accelerates LLM inference by having a lightweight draft model propose speculative windows of candidate tokens for parallel verification by a larger target mode…