1 paper · 1 filter
Abdurrahman Javat, Allan Kazakov
Speculative decoding accelerates autoregressive language model inference by using a cheap drafter to propose multiple future tokens and a target model to verify them. A common desi…