1 paper
Sayed Mohammadreza Tayaranian Hosseini, Amir Ardakani, Warren J. Gross
When transformer-based language models are deployed for text generation, most of the inference time is spent in the decoding stage, where output tokens are generated sequentially.…