1 paper · 1 filter
Hailong Yang, Jianqi Wang, Guanjin Wang +1
In Multimodal Question Answering (MQA), models are required to jointly encode and integrate heterogeneous information from multiple modalities, including text, images, and speech,…