1 paper · 1 filter
Jiaming Fan, Daming Cao, Canchen Huang +6
Speculative decoding accelerates large language model inference through a draft-then-verify paradigm. Building on this, tree-structured methods improve inference by organizing prop…