1 paper · 1 filter
Tianyu Wang, Yuxuan Zhou, Heng Li +4
Speculative Decoding (SD) accelerates large language model inference by allowing a lightweight draft model to propose tokens that are subsequently verified in parallel by a larger…