1 paper · 1 filter
Ali Rasekh, Erfan Bagheri Soula, Omid Daliran +2
Despite significant advances in Multimodal Large Language Models (MLLMs), understanding complex temporal dynamics in videos remains a major challenge. Our experiments show that cur…