1 paper
Jean Park, Kuk Jin Jang, Basam Alasaly +5
Multimodal large language models (MLLMs) can simultaneously process visual, textual, and auditory data, capturing insights that complement human analysis. However, existing video q…