1 paper
Shehan Munasinghe, Hanan Gani, Wenqi Zhu +4
Fine-grained alignment between videos and text is challenging due to complex spatial and temporal dynamics in videos. Existing video-based Large Multimodal Models (LMMs) handle bas…