1 paper
Xiangxiang Gao, Weisheng Xie, Yiwei Xiang +1
Striking an optimal balance between minimal drafting latency and high speculation accuracy to enhance the inference speed of Large Language Models remains a significant challenge i…