1 paper · 1 filter
Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang +4
Current vision-language models (VLMs) have demonstrated remarkable capabilities across diverse video understanding applications. Designing VLMs for video inputs requires effectivel…