1 paper
Zixing Lin, Jiale Wang, Gee Wah Ng +4
Large Multimodal Models (LMMs) for video-audio understanding have traditionally been evaluated only on shorter videos of a few minutes long. In this paper, we introduce QMAVIS (Q T…