1 paper
Hailong Yang, Jianqi Wang, Guanjin Wang +1
In Multimodal Question Answering (MQA), models are required to jointly encode and integrate heterogeneous information from multiple modalities, including text, images, and speech,…