1 paper
Minji Kim, Taekyung Kim, Bohyung Han
Video Large Language Models (VideoLLMs) extend the capabilities of vision-language models to spatiotemporal inputs, enabling tasks such as video question answering (VideoQA). Despi…