1 paper · 1 filter
Weiheng Lu, Jian Li, An Yu +3
Multimodal Large Language Models (MLLMs) are widely used for visual perception, understanding, and reasoning. However, long video processing and precise moment retrieval remain cha…