1 paper
Lehan Pan, Ziyang Tao, Ruoyu Pang +3
Tree-based speculative decoding accelerates autoregressive generation by verifying multiple draft candidates in parallel, but this advantage weakens for sparse Mixture-of-Experts (…