1 paper
Ali Rasekh, Erfan Bagheri Soula, Omid Daliran +2
Despite significant advances in Multimodal Large Language Models (MLLMs), understanding complex temporal dynamics in videos remains a major challenge. Our experiments show that cur…