1 paper · 1 filter
Konrad Staniszewski, Adrian ÅaÅcucki
Serving large language models (LLMs) at scale necessitates efficient key-value (KV) cache management. KV caches can be reused across conversation turns via shared-prefix prompts th…