1 paper · 1 filter
Ziyi Chen, Xiaocong Yang, Jiacheng Lin +3
Introduced to enhance the efficiency of large language model (LLM) inference, speculative decoding operates by having a smaller model generate a draft. A larger target model then r…