1 paper
Chang Han, Yijie Hu, Jingling Liu
Autoregressive decoding remains a primary bottleneck in large language model (LLM) serving, motivating speculative decoding methods that reduce expensive teacher-model invocations…