1 paper
Mohamad Zbib, Mohamad Bazzi, Ammar Mohanna +2
Speculative decoding accelerates autoregressive generation by letting a lightweight draft model propose future tokens that a larger target model then verifies in parallel. In pract…