1 paper
Michele Marzollo, Jiawei Zhuang, Niklas Roemer +3
Speculative Decoding has emerged as a popular technique for accelerating inference in Large Language Models. However, most existing approaches yield only modest improvements in pro…