1 paper
Yufan Jiang, Qiaozhi He, Xiaomin Zhuang +4
Existing large language models have to run K times to generate a sequence of K tokens. In this paper, we present RecycleGPT, a generative language model with fast decoding speed by…