1 paper
Donghyuk Kim, Sejeong Yang, Wonjin Shin +1
Streaming video large language models (LLMs) are increasingly used for real-time multimodal tasks such as video captioning, question answering, conversational agents, and augmented…