1 paper · 1 filter
Sameer Malik, Moyuru Yamada, Ayush Singh +1
Comprehending long videos remains a significant challenge for Large Multi-modal Models (LMMs). Current LMMs struggle to process even minutes to hours videos due to their lack of ex…