1 paper
Rakesh Raj Madavan, Akshat Kaimal, Hashim Faisal +1
An ensemble of trained multimodal encoders and vision-language models (VLMs) has become a standard approach for visual question answering (VQA) tasks. However, such models often fa…