1 paper
Sheng Li, Peng Liu, Qianqian Zhang +1
Real-world video understanding requires integrating visual, audio, textual, and temporal evidence distributed across a video. Yet many pipelines use a fixed video context and singl…