1 paper
Jinming Wen, Xinyi Wu, Shuai Zhao +2
Multimodal large language models (MLLMs), which bridge the gap between audio-visual and natural language processing, achieve state-of-the-art performance on several audio-visual ta…