2 papers
cs.CV2026
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
Morunliu Yang, Ruotao Xu, Le Li +6
Omnimodal large language models (OmniLLMs) have recently gained increasing attention for unified audio-video understanding. However, processing long multimodal token sequences intr…
cs.CL2025
: Attention-Aware Accurate KV Cache Fusion for Fast Large Language Model Serving
Yuechi Zhou, Yi Su, Jianxin Zhang +5
Large language models (LLMs) have demonstrated strong capabilities in processing long contexts, enabling them to tackle tasks involving long textual inputs such as multi-turn conve…