1 paper · 1 filter
Jean Park, Kuk Jin Jang, Basam Alasaly +5
Multimodal large language models (MLLMs) can simultaneously process visual, textual, and auditory data, capturing insights that complement human analysis. However, existing video q…