1 paper
Hong Gao, Yiming Bao, Xuezhen Tu +6
Video understanding requires not only visual recognition but also complex reasoning. While Vision-Language Models (VLMs) demonstrate impressive capabilities, they typically process…