1 paper · 1 filter
Yuxuan Hu, Ke Wang, Xiaokang Zhang +4
Speculative decoding (SD) has been demonstrated as an effective technique for lossless LLM inference acceleration. Retrieval-based SD methods, one kind of model-free method, have y…