1 paper
Anxhelo Diko, Tinghuai Wang, Wassim Swaileh +2
Vision-Language Models (VLMs) are crucial for applications requiring integrated understanding textual and visual information. However, existing VLMs struggle with long videos due t…