1 paper · 1 filter
Sergey Pankratov, Dan Alistarh
Speculative generation has emerged as a promising technique to accelerate inference in large language models (LLMs) by leveraging parallelism to verify multiple draft tokens simult…