1 paper
Aditya Anirudh Jonnalagadda, Agasthi Haputhanthri, Pranav Dangi +5
The key-value (KV) cache has become the dominant consumer of memory in large language model (LLM) serving systems as context lengths, concurrency, and request lifetimes grow. High-…