2 papers
cs.LG2026
Acceptance-Aware Draft Model Training for Speculative Decoding
Tianhua Xia, Mugilan Ganesan, Yifei Feng +3
Speculative decoding accelerates large language model (LLM) inference by using a lightweight draft model to generate multiple candidate tokens that are verified by the target model…
cs.CL2025
Automatic Task Detection and Heterogeneous LLM Speculative Decoding
Danying Ge, Jianhua Gao, Qizhi Jiang +2
Speculative decoding, which combines a draft model with a target model, has emerged as an effective approach to accelerate large language model (LLM) inference. However, existing m…