1 paper
Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1
Omni-modal LLMs jointly process audio, video, and text, but long multimodal sequences incur substantial prefill and KV-cache costs. Existing omni-modal compression methods primaril…