1 paper · 1 filter
Beibei Zhang, Chao Xu, Jun Lan +4
Though Multimodal Large Language Models (MLLMs) have shown impressive potential in video understanding, long video understanding (LVU) remains challenging since distracting noise i…