1 paper
Cui Yakun, Xingqun Qi, TianTian Geng +3
Recent advances in Vision-Language Models (VLMs) have substantially enhanced their ability across multimodal video understanding benchmarks spanning temporal, action, object, and s…