1 paper
Xiandong Zou, Jianshu Li, Jing Huang +1
Speculative decoding accelerates inference for (M)LLMs, yet a training-decoding discrepancy persists: while existing methods optimize single greedy trajectories, decoding involves…