1 paper
Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang +4
Current vision-language models (VLMs) have demonstrated remarkable capabilities across diverse video understanding applications. Designing VLMs for video inputs requires effectivel…