1 paper
Sergey Pankratov, Dan Alistarh
Speculative generation has emerged as a promising technique to accelerate inference in large language models (LLMs) by leveraging parallelism to verify multiple draft tokens simult…