1 paper
Shuai Zhang, Huachuan Qiu, Hongliang He +1
Speculative decoding accelerates inference by having a lightweight drafter propose tokens verified in parallel by the target language model. Block diffusion drafters such as DFlash…