1 paper
Xingyang He, Jie Liu, Shaowei Chen
KV cache is a widely used acceleration technique for large language models (LLMs) inference. However, its memory requirement grows rapidly with input length. Previous studies have…