DVQA: Understanding Data Visualizations via Question Answering
arXiv:1801.08163
Abstract
Bar charts are an effective way to convey numeric information, but today's algorithms cannot parse them. Existing methods fail when faced with even minor variations in appearance. Here, we present DVQA, a dataset that tests many aspects of bar chart understanding in a question answering framework. Unlike visual question answering (VQA), DVQA requires processing words and answers that are unique to a particular bar chart. State-of-the-art VQA algorithms perform poorly on DVQA, and we propose two strong baselines that perform considerably better. Our work will enable algorithms to automatically extract numeric and semantic information from vast quantities of bar charts found in scientific publications, Internet articles, business reports, and many other areas.
CVPR 2018 Camera Ready Version
References in corpus (6)
- Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering
- FigureQA: An Annotated Figure Dataset for Visual Reasoning
- Learning to Reason: End-to-End Module Networks for Visual Question Answering
- CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning
- Visual Question Answering: A Survey of Methods and Datasets
- An Analysis of Visual Question Answering Algorithms
Cited by in corpus (7)
- Meta Module Network for Compositional Visual Reasoning
- Answering Visual What-If Questions: From Actions to Predicted Scene Descriptions
- DocVQA: A Dataset for VQA on Document Images
- VQD: Visual Query Detection in Natural Scenes
- MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
- TallyQA: Answering Complex Counting Questions
- ManyModalQA: Modality Disambiguation and QA over Diverse Inputs