1 paper
Zhuoyu Wang, Junnan Huang, Xinyu Chen
Using a diffusion model for parallel drafting is a promising approach for speculative decoding. By predicting tokens at multiple future positions in a single forward pass, diffusio…