1 paper
Yichi Zhang, Zhiqi Wang, Huan Zhang +1
Key-Value (KV) cache reduces inference latency in large language models (LLMs). Traditional prefix-based reuse has low cache hit rates across inference requests because it requires…