1 paper
Muxin Fu, Yifan Zhang, Wentao Zhang +5
Streaming video understanding requires multimodal large language models (MLLMs) to preserve relevant evidence from continuously evolving streams under strict causality and bounded…