1 paper · 1 filter
Minjae Lee, Wonjun Kang, Byeongkeun Ahn +6
Speculative decoding (SD) has proven effective for accelerating LLM inference by quickly generating draft tokens and verifying them in parallel. However, SD remains largely unexplo…