1 paper · 1 filter
Zunhai Su, Wang Shen, Linge Li +4
Vision-language models (VLMs) show remarkable performance in multimodal tasks. However, excessively long multimodal inputs lead to oversized Key-Value (KV) caches, resulting in sig…