Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering
arXiv:1704.03162
Abstract
This paper presents a new baseline for visual question answering task. Given an image and a question in natural language, our model produces accurate answers according to the content of the image. Our model, while being architecturally simple and relatively small in terms of trainable parameters, sets a new state of the art on both unbalanced and balanced VQA benchmark. On VQA 1.0 open ended challenge, our model achieves 64.6% accuracy on the test-standard set without using additional data, an improvement of 0.4% over state of the art, and on newly released VQA 2.0, our model scores 59.7% on validation set outperforming best previously reported results by 0.5%. The results presented in this paper are especially interesting because very similar models have been tried before but significantly lower performance were reported. In light of the new results we hope to see more meaningful research on visual question answering in the future.
Cited by in corpus (36)
- Pathologies of Neural Models Make Interpretations Difficult
- Learning to Count Objects in Natural Images for Visual Question Answering
- Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering
- From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities
- Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering
- Vision-to-Language Tasks Based on Attributes and Attention Mechanism
- High-Order Attention Models for Visual Question Answering
- OpenViVQA: Task, Dataset, and Multimodal Fusion Models for Visual Question Answering in Vietnamese
- DVQA: Understanding Data Visualizations via Question Answering
- A Closer Look at the Robustness of Vision-and-Language Pre-trained Models
- Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention
- REMIND Your Neural Network to Prevent Catastrophic Forgetting
- VQA-E: Explaining, Elaborating, and Enhancing Your Answers for Visual Questions
- Explainable High-order Visual Question Reasoning: A New Benchmark and Knowledge-routed Network
- Learning Visual Question Answering by Bootstrapping Hard Attention
- Leveraging Medical Visual Question Answering with Supporting Facts
- Survey of Recent Advances in Visual Question Answering
- A Study on Multimodal and Interactive Explanations for Visual Question Answering
- Attending to Discriminative Certainty for Domain Adaptation
- Leveraging Visual Question Answering to Improve Text-to-Image Synthesis
- MAT: A simple yet strong baseline for identifying self-admitted technical debt
- Dual Recurrent Attention Units for Visual Question Answering
- Loss re-scaling VQA: Revisiting the LanguagePrior Problem from a Class-imbalance View
- Answering Questions about Data Visualizations using Efficient Bimodal Fusion
- Quantifying and Alleviating the Language Prior Problem in Visual Question Answering
- Text Guided Person Image Synthesis
- Latent Variable Models for Visual Question Answering
- Question Guided Modular Routing Networks for Visual Question Answering
- PyTorchPipe: a framework for rapid prototyping of pipelines combining language and vision
- Learning Question-Guided Video Representation for Multi-Turn Video Question Answering
- Unsupervised Keyword Extraction for Full-sentence VQA
- Using Text to Teach Image Retrieval
- Learning to Represent and Predict Sets with Deep Neural Networks
- Visual Question Answering Using Semantic Information from Image Descriptions
- Generating and Evaluating Explanations of Attended and Error-Inducing Input Regions for VQA Models
- Reproducibility Report for "Learning To Count Objects In Natural Images For Visual Question Answering"