76 citations · 218 across the 10 of their papers we have counts for
1 paper · 1 filter
Bradley McDanel, Sai Qian Zhang, Yunhai Hu +1
Speculative decoding accelerates large language model inference by using smaller draft models to generate candidate tokens for parallel verification. However, current approaches ar…