1 paper
Jiankun Wei, Abdulrahman Abdulrazzag, Tianchen Zhang +2
Deployed large language models (LLMs) often rely on speculative decoding, a technique that generates and verifies multiple candidate tokens in parallel, to improve throughput and l…