1 paper · 1 filter
Ziyi Wang, Siva Rajesh Kasa, Ankith M S +6
Speculative decoding is an effective technique for accelerating large language model inference by drafting multiple tokens in parallel. In practice, its speedup is often bottleneck…