Visual Reference Resolution using Attention Memory for Visual Dialog
arXiv:1709.07992
Abstract
Visual dialog is a task of answering a series of inter-dependent questions given an input image, and often requires to resolve visual references among the questions. This problem is different from visual question answering (VQA), which relies on spatial attention (a.k.a. visual grounding) estimated from an image and question pair. We propose a novel attention mechanism that exploits visual attentions in the past to resolve the current reference in the visual dialog scenario. The proposed model is equipped with an associative attention memory storing a sequence of previous (attention, key) pairs. From this memory, the model retrieves the previous attention, taking into account recency, which is most relevant for the current question, in order to resolve potentially ambiguous references. The model then merges the retrieved attention with a tentative one to obtain the final attention for the current question; specifically, we use dynamic parameter prediction to combine the two attentions conditioned on the question. Through extensive experiments on a new synthetic visual dialog dataset, we show that our model significantly outperforms the state-of-the-art (by ~16 % points) in situations, where visual reference resolution plays an important role. Moreover, the proposed model achieves superior performance (~ 2 % points improvement) in the Visual Dialog dataset, despite having significantly fewer parameters than the baselines.
References in corpus (3)
Cited by in corpus (24)
- Dialog-based Interactive Image Retrieval
- Trends in Integration of Vision and Language Research: A Survey of Tasks, Datasets, and Methods
- VD-BERT: A Unified Vision and Dialog Transformer with BERT
- Multi-step Reasoning via Recurrent Dual Attention for Visual Dialog
- Reasoning Visual Dialogs with Structural and Partial Observations
- Measuring Compositionality in Representation Learning
- Multi-step Joint-Modality Attention Network for Scene-Aware Dialogue System
- OpenViDial: A Large-Scale, Open-Domain Dialogue Dataset with Visual Contexts
- Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning
- Factor Graph Attention
- Modeling Text-visual Mutual Dependency for Multi-modal Dialog Generation
- Making History Matter: History-Advantage Sequence Training for Visual Dialog
- Dual Attention Networks for Visual Reference Resolution in Visual Dialog
- Modular Generative Adversarial Networks
- DualVD: An Adaptive Dual Encoding Model for Deep Visual Understanding in Visual Dialogue
- Recursive Visual Attention in Visual Dialog
- OpenViDial 2.0: A Larger-Scale, Open-Domain Dialogue Generation Dataset with Visual Contexts
- Modeling Explicit Concerning States for Reinforcement Learning in Visual Dialogue
- KBGN: Knowledge-Bridge Graph Network for Adaptive Vision-Text Reasoning in Visual Dialogue
- DVD: A Diagnostic Dataset for Multi-step Reasoning in Video Grounded Dialogue
- DMRM: A Dual-channel Multi-hop Reasoning Model for Visual Dialog
- Reasoning Over History: Context Aware Visual Dialog
- Traversing the Continuous Spectrum of Image Retrieval with Deep Dynamic Models
- Saying the Unseen: Video Descriptions via Dialog Agents