1 paper
Yuezhou Hu, Jiaxin Guo, Xinyu Feng +1
Speculative Decoding (SD) accelerates large language model inference by employing a small draft model to generate predictions, which are then verified by a larger target model. The…