1 paper
Shaowen Chen, Zhicheng Liao, Hongwei Wang
Speculative Decoding (SD) accelerates Large Language Model (LLM) inference by employing a lightweight draft model to propose candidate tokens, which are verified in parallel by the…