1 paper · 1 filter
He Sun, Shinan Liu, Siyuan Ma +3
Modern Large Language Model (LLM) serving engines increasingly rely on Retrieval-Augmented Generation (RAG) and non-prefix Key-Value (KV) cache fusion to accelerate long-context, m…