1 paper
Sibo Xiao, Jinyuan Fu, Zhongle Xie +1
Accelerating the inference of large language models (LLMs) has been a critical challenge in generative AI. Speculative decoding (SD) substantially improves LLM inference efficiency…