1 paper
Wei Song, Yuxin Cao, Ziqi Ding +3
Video large language models (VideoLLMs) are increasingly trained or instruction-tuned on large-scale video--text corpora collected from heterogeneous sources, raising an immediate…