1 paper · 1 filter
Ruilin Wang, Huixia Li, Yuexiao Ma +4
Inference latency stands as a critical bottleneck in the large-scale deployment of Large Language Models (LLMs). Speculative decoding methods have recently shown promise in acceler…