1 paper
Humair Raj Khan, Deepak Gupta, Asif Ekbal
Pre-trained language-vision models have shown remarkable performance on the visual question answering (VQA) task. However, most pre-trained models are trained by only considering m…