1 paper · 1 filter
Kiran Purohit, Ramasuri Narayanam, Soumyabrata Pal
Speculative decoding (SD) accelerates large language model inference by allowing a lightweight draft model to propose outputs that a stronger target model verifies. However, its to…