1 paper
Xiabin Zhou, Wenbin Wang, Minyan Zeng +5
Efficient KV cache management in LLMs is crucial for long-context tasks like RAG and summarization. Existing KV cache compression methods enforce a fixed pattern, neglecting task-s…