1 paper
Mugilan Ganesan, Shane Segal, Ankur Aggarwal +3
Speculative decoding significantly accelerates language model inference by enabling a lightweight draft model to propose multiple tokens that a larger target model verifies simulta…