1 paper
Alexander Samarin, Sergei Krutikov, Anton Shevtsov +3
Speculative decoding accelerates autoregressive large language model (LLM) inference by using a lightweight draft model to propose candidate tokens that are then verified in parall…