1 paper · 1 filter
Haiyue Zhang, Yi Bin, Xun Jiang +5
Large vision-language models (LVLMs) have achieved significant progress in video understanding, yet understanding long videos remains challenging due to the large number of visual…