Show, Attend and Tell: Neural Image Caption Generation with Visual Attention
arXiv:1502.03044
Abstract
Inspired by recent work in machine translation and object detection, we introduce an attention based model that automatically learns to describe the content of images. We describe how we can train this model in a deterministic manner using standard backpropagation techniques and stochastically by maximizing a variational lower bound. We also show through visualization how the model is able to automatically learn to fix its gaze on salient objects while generating the corresponding words in the output sequence. We validate the use of attention with state-of-the-art performance on three benchmark datasets: Flickr8k, Flickr30k and MS COCO.
References in corpus (10)
- Very Deep Convolutional Networks for Large-Scale Image Recognition
- Sequence to Sequence Learning with Neural Networks
- Practical Bayesian Optimization of Machine Learning Algorithms
- Recurrent Neural Network Regularization
- Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models
- Theano: new features and speed improvements
- Recurrent Models of Visual Attention
- DRAW: A Recurrent Neural Network For Image Generation
- Learning a Recurrent Visual Representation for Image Caption Generation
- The Optimal Reward Baseline for Gradient-Based Reinforcement Learning
Cited by in corpus (1520)
- Convolutional LSTM Network: A Machine Learning Approach for Precipitation Nowcasting
- A Brief Survey of Deep Reinforcement Learning
- A Survey on Visual Transformer
- Attention Mechanisms in Computer Vision: A Survey
- Generative Adversarial Text to Image Synthesis
- Predicting Cardiovascular Risk Factors from Retinal Fundus Photographs using Deep Learning
- Attention-Based Models for Speech Recognition
- Explaining Deep Neural Networks and Beyond: A Review of Methods and Applications
- Explaining NonLinear Classification Decisions with Deep Taylor Decomposition
- Validation, comparison, and combination of algorithms for automatic detection of pulmonary nodules in computed tomography images: the LUNA16 challenge
- A Survey of Deep Learning-based Object Detection
- Enhanced LSTM for Natural Language Inference
- Recent advances and clinical applications of deep learning in medical image analysis
- Evolution Strategies as a Scalable Alternative to Reinforcement Learning
- A Survey on the Explainability of Supervised Machine Learning
- Sequence Level Training with Recurrent Neural Networks
- Show and Tell: Lessons learned from the 2015 MSCOCO Image Captioning Challenge
- Deep neural network models for computational histopathology: A survey
- Effective Approaches to Attention-based Neural Machine Translation
- Model-Agnostic Interpretability of Machine Learning
- A General Survey on Attention Mechanisms in Deep Learning
- Attention-based Deep Multiple Instance Learning
- End-To-End Memory Networks
- Attention in Natural Language Processing
- Ask Me Anything: Dynamic Memory Networks for Natural Language Processing
- Human Action Recognition from Various Data Modalities: A Review
- Beyond Bilinear: Generalized Multimodal Factorized High-order Pooling for Visual Question Answering
- This Looks Like That: Deep Learning for Interpretable Image Recognition
- Object Detection in 20 Years: A Survey
- The Goldilocks Principle: Reading Children's Books with Explicit Memory Representations
- Multimodal Intelligence: Representation Learning, Information Fusion, and Applications
- Attention is not Explanation
- An End-to-End Spatio-Temporal Attention Model for Human Action Recognition from Skeleton Data
- Session-based Social Recommendation via Dynamic Graph Attention Networks
- From Softmax to Sparsemax: A Sparse Model of Attention and Multi-Label Classification
- Improved Image Captioning via Policy Gradient optimization of SPIDEr
- A Literature Survey of Recent Advances in Chatbots
- Scalable Bayesian Optimization Using Deep Neural Networks
- Artificial neural networks for neuroscientists: A primer
- Exploring Models and Data for Image Question Answering
- A Dual-Stage Attention-Based Recurrent Neural Network for Time Series Prediction
- Variational Autoencoder for Deep Learning of Images, Labels and Captions
- Human-in-the-loop Artificial Intelligence
- Action Recognition using Visual Attention
- "Why Should I Trust You?": Explaining the Predictions of Any Classifier
- CBAM: Convolutional Block Attention Module
- Professor Forcing: A New Algorithm for Training Recurrent Networks
- Attentive Pooling Networks
- Fast Parallel Hypertree Decompositions in Logarithmic Recursion Depth
- Residual Attention Network for Image Classification
- Foreground Segmentation Using a Triplet Convolutional Neural Network for Multiscale Feature Encoding
- Listen, Attend and Spell
- Modulating early visual processing by language
- Aligning Books and Movies: Towards Story-like Visual Explanations by Watching Movies and Reading Books
- Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers
- Working Memory Connections for LSTM
- Contrastive Learning of Medical Visual Representations from Paired Images and Text
- BS-Nets: An End-to-End Framework For Band Selection of Hyperspectral Image
- Feed-Forward Networks with Attention Can Solve Some Long-Term Memory Problems
- VLP: A Survey on Vision-Language Pre-training
- A critical examination of compound stability predictions from machine-learned formation energies
- Visual Question Answering: Datasets, Algorithms, and Future Challenges
- What Clinicians Want: Contextualizing Explainable Machine Learning for Clinical End Use
- Adversarial Attacks on Deep Learning Models in Natural Language Processing: A Survey
- SPAN: Spatial Pyramid Attention Network forImage Manipulation Localization
- GaAN: Gated Attention Networks for Learning on Large and Spatiotemporal Graphs
- Temporal Attention augmented Bilinear Network for Financial Time-Series Data Analysis
- Attention-based Graph Neural Network for Semi-supervised Learning
- AUTSL: A Large Scale Multi-modal Turkish Sign Language Dataset and Baseline Methods
- HANet: A Hierarchical Attention Network for Change Detection With Bitemporal Very-High-Resolution Remote Sensing Images
- Are You Talking to a Machine? Dataset and Methods for Multilingual Image Question Answering
- Image Captioning with Semantic Attention
- Efficient-CapsNet: Capsule Network with Self-Attention Routing
- SCAR: Spatial-/Channel-wise Attention Regression Networks for Crowd Counting
- Learning to Remember Rare Events
- ReNet: A Recurrent Neural Network Based Alternative to Convolutional Networks
- Hybrid Retrieval-Generation Reinforced Agent for Medical Image Report Generation
- Online and Linear-Time Attention by Enforcing Monotonic Alignments
- LXMERT: Learning Cross-Modality Encoder Representations from Transformers
- An Actor-Critic Algorithm for Sequence Prediction
- Stand-Alone Self-Attention in Vision Models
- RETAIN: An Interpretable Predictive Model for Healthcare using Reverse Time Attention Mechanism
- Exploring a Fine-Grained Multiscale Method for Cross-Modal Remote Sensing Image Retrieval
- Knowledge Matters: Radiology Report Generation with General and Specific Knowledge
- Multimodal Co-learning: Challenges, Applications with Datasets, Recent Advances and Future Directions
- Multi-modal Understanding and Generation for Medical Images and Text via Vision-Language Pre-Training
- Phased LSTM: Accelerating Recurrent Network Training for Long or Event-based Sequences
- A Hierarchical Neural Autoencoder for Paragraphs and Documents
- Adversarial Text-to-Image Synthesis: A Review
- Transparency by Design: Closing the Gap Between Performance and Interpretability in Visual Reasoning
- Attention-based Convolutional Neural Network for Weakly Labeled Human Activities Recognition with Wearable Sensors
- MASTER: Multi-Aspect Non-local Network for Scene Text Recognition
- Attention Enriched Deep Learning Model for Breast Tumor Segmentation in Ultrasound Images
- Recurrently Exploring Class-wise Attention in A Hybrid Convolutional and Bidirectional LSTM Network for Multi-label Aerial Image Classification
- Local Rule-Based Explanations of Black Box Decision Systems
- Interactive and Explainable Region-guided Radiology Report Generation
- Causal Attention for Interpretable and Generalizable Graph Classification
- Contextual LSTM (CLSTM) models for Large scale NLP tasks
- Describing Videos by Exploiting Temporal Structure
- Deep learning for predicting refractive error from retinal fundus images
- ST-GRAT: A Novel Spatio-temporal Graph Attention Network for Accurately Forecasting Dynamically Changing Road Speed
- STA: Spatial-Temporal Attention for Large-Scale Video-based Person Re-Identification
- Reinforcement Learning for Solving the Vehicle Routing Problem
- Deeply-Learned Part-Aligned Representations for Person Re-Identification
- Visual Entailment: A Novel Task for Fine-Grained Image Understanding
- Exploring Nearest Neighbor Approaches for Image Captioning
- A Survey on Aspect-Based Sentiment Classification
- AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks
- Context-Aware Visual Policy Network for Fine-Grained Image Captioning
- Texygen: A Benchmarking Platform for Text Generation Models
- Multimodal Machine Learning: A Survey and Taxonomy
- Beyond Part Models: Person Retrieval with Refined Part Pooling (and a Strong Convolutional Baseline)
- Understanding LSTM -- a tutorial into Long Short-Term Memory Recurrent Neural Networks
- Script Identification in Natural Scene Image and Video Frame using Attention based Convolutional-LSTM Network
- Robust Attentional Aggregation of Deep Feature Sets for Multi-view 3D Reconstruction
- End-to-End Deep Reinforcement Learning for Lane Keeping Assist
- Rolling-Unrolling LSTMs for Action Anticipation from First-Person Video
- Learning Deep Representations of Fine-grained Visual Descriptions
- Learning to Discover Multi-Class Attentional Regions for Multi-Label Image Recognition
- RandLA-Net: Efficient Semantic Segmentation of Large-Scale Point Clouds
- ImageNet pre-trained models with batch normalization
- A Convolutional Attention Network for Extreme Summarization of Source Code
- Optimization for deep learning: theory and algorithms
- Clinically Accurate Chest X-Ray Report Generation
- Predicting Deep Zero-Shot Convolutional Neural Networks using Textual Descriptions
- Image-Grounded Conversations: Multimodal Context for Natural Question and Response Generation
- Generation and Comprehension of Unambiguous Object Descriptions
- Semantic-Aware Scene Recognition
- Explainable Outfit Recommendation with Joint Outfit Matching and Comment Generation
- Pix2seq: A Language Modeling Framework for Object Detection
- Drivers Drowsiness Detection using Condition-Adaptive Representation Learning Framework
- Interventional Few-Shot Learning
- 3D PersonVLAD: Learning Deep Global Representations for Video-based Person Re-identification
- Learn To Pay Attention
- Context-Aware Visual Policy Network for Sequence-Level Image Captioning
- FFA-Net: Feature Fusion Attention Network for Single Image Dehazing
- Recurrent Mixture Density Network for Spatiotemporal Visual Attention
- Levels of explainable artificial intelligence for human-aligned conversational explanations
- Attention for Fine-Grained Categorization
- Conditional Generation Net for Medication Recommendation
- Indoor Scene Understanding in 2.5/3D for Autonomous Agents: A Survey
- End-to-End Object Detection with Adaptive Clustering Transformer
- Dialog-based Interactive Image Retrieval
- On the Dimensionality of Word Embedding
- Women also Snowboard: Overcoming Bias in Captioning Models
- Supervised and Unsupervised Neural Approaches to Text Readability
- Towards Universal Paraphrastic Sentence Embeddings
- Recent Advances in Deep Learning: An Overview
- Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and Graph Attention Networks
- Toward Explainable AI for Regression Models
- Distilling Knowledge from Deep Networks with Applications to Healthcare Domain
- Light-Weight RefineNet for Real-Time Semantic Segmentation
- Self-Adversarial Training incorporating Forgery Attention for Image Forgery Localization
- SD-RSIC: Summarization Driven Deep Remote Sensing Image Captioning
- Boosted EfficientNet: Detection of Lymph Node Metastases in Breast Cancer Using Convolutional Neural Network
- Scene Text Detection and Recognition: The Deep Learning Era
- Review: Deep Learning in Electron Microscopy
- Listen, Attend, and Walk: Neural Mapping of Navigational Instructions to Action Sequences
- RobustFill: Neural Program Learning under Noisy I/O
- Towards Diverse and Natural Image Descriptions via a Conditional GAN
- The Consciousness Prior
- WT5?! Training Text-to-Text Models to Explain their Predictions
- Changes to Captions: An Attentive Network for Remote Sensing Change Captioning
- Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering
- Learning Deep Structured Multi-Scale Features using Attention-Gated CRFs for Contour Prediction
- An Empirical Study of Spatial Attention Mechanisms in Deep Networks
- Multi-modal Factorized Bilinear Pooling with Co-Attention Learning for Visual Question Answering
- Deep Reinforcement Learning for Visual Object Tracking in Videos
- Survey on the attention based RNN model and its applications in computer vision
- A Survey of Deep Learning Techniques for Neural Machine Translation
- Deep Modular Co-Attention Networks for Visual Question Answering
- Adv-BNN: Improved Adversarial Defense through Robust Bayesian Neural Network
- AttSum: Joint Learning of Focusing and Summarization with Neural Attention
- Actor-Critic Sequence Training for Image Captioning
- Fixed Pattern Noise Reduction for Infrared Images Based on Cascade Residual Attention CNN
- Feature Control as Intrinsic Motivation for Hierarchical Reinforcement Learning
- Mutual Information and Diverse Decoding Improve Neural Machine Translation
- Fluency-Guided Cross-Lingual Image Captioning
- Deep Ordinal Hashing with Spatial Attention
- DELTA: DEep Learning Transfer using Feature Map with Attention for Convolutional Networks
- Black-Box Attacks against RNN based Malware Detection Algorithms
- Attribute2Image: Conditional Image Generation from Visual Attributes
- Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering
- Survey on Visual Sentiment Analysis
- Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning
- HydraPlus-Net: Attentive Deep Features for Pedestrian Analysis
- Where to put the Image in an Image Caption Generator
- Natural Language Generation for Electronic Health Records
- Visual Reference Resolution using Attention Memory for Visual Dialog
- TREND: TempoRal Event and Node Dynamics for Graph Representation Learning
- Referring Segmentation in Images and Videos with Cross-Modal Self-Attention Network
- On the Origin of Deep Learning
- Forward Attention in Sequence-to-sequence Acoustic Modelling for Speech Synthesis
- Hierarchical Object Detection with Deep Reinforcement Learning
- Quasi-hyperbolic momentum and Adam for deep learning
- Deep Metric Learning-based Image Retrieval System for Chest Radiograph and its Clinical Applications in COVID-19
- Best of Both Worlds: Transferring Knowledge from Discriminative Learning to a Generative Visual Dialog Model
- From Easy to Hard: Learning Language-guided Curriculum for Visual Question Answering on Remote Sensing Data
- Every Moment Counts: Dense Detailed Labeling of Actions in Complex Videos
- Beyond Self-attention: External Attention using Two Linear Layers for Visual Tasks
- DenseCap: Fully Convolutional Localization Networks for Dense Captioning
- Weakly Labelled AudioSet Tagging with Attention Neural Networks
- Clinical Intervention Prediction and Understanding using Deep Networks
- Memory-augmented Dense Predictive Coding for Video Representation Learning
- Dialog-based Language Learning
- Noisy Activation Functions
- Video Summarization with Long Short-term Memory
- Attention Guided Graph Convolutional Networks for Relation Extraction
- Representation Learning for Natural Language Processing
- Medical-VLBERT: Medical Visual Language BERT for COVID-19 CT Report Generation With Alternate Learning
- On Identifiability in Transformers
- Optimizing Performance of Recurrent Neural Networks on GPUs
- Sparse Sinkhorn Attention
- Recurrent Topic-Transition GAN for Visual Paragraph Generation
- Explicit Sparse Transformer: Concentrated Attention Through Explicit Selection
- Towards Goal-Oriented Semantic Signal Processing: Applications and Future Challenges
- IENet: Interacting Embranchment One Stage Anchor Free Detector for Orientation Aerial Object Detection
- Language-guided Navigation via Cross-Modal Grounding and Alternate Adversarial Learning
- Dual Attention Matching Network for Context-Aware Feature Sequence based Person Re-Identification
- One-Shot Generalization in Deep Generative Models
- Does Multimodality Help Human and Machine for Translation and Image Captioning?
- DESIRE: Distant Future Prediction in Dynamic Scenes with Interacting Agents
- Learning Multi-Attention Context Graph for Group-Based Re-Identification
- Guiding Long-Short Term Memory for Image Caption Generation
- Attention Correctness in Neural Image Captioning
- Generating Visual Explanations
- MirrorGAN: Learning Text-to-image Generation by Redescription
- Pose-conditioned Spatio-Temporal Attention for Human Action Recognition
- Generating Images from Captions with Attention
- Decoupled Novel Object Captioner
- Learning Language-Visual Embedding for Movie Understanding with Natural-Language
- Full Page Handwriting Recognition via Image to Sequence Extraction
- Multilingual Image Description with Neural Sequence Models
- Causal Intervention for Weakly-Supervised Semantic Segmentation
- Attention-Based Deep Learning Framework for Human Activity Recognition with User Adaptation
- Neural Programmer: Inducing Latent Programs with Gradient Descent
- CNN+CNN: Convolutional Decoders for Image Captioning
- Context-aware Natural Language Generation with Recurrent Neural Networks
- Attention Interpretability Across NLP Tasks
- Neural Abstractive Text Summarization with Sequence-to-Sequence Models
- Attention-guided Context Feature Pyramid Network for Object Detection
- Building and Interpreting Deep Similarity Models
- Convolutional Hierarchical Attention Network for Query-Focused Video Summarization
- Relation Networks for Object Detection
- Neural Extractive Summarization with Side Information
- Diverse and Accurate Image Description Using a Variational Auto-Encoder with an Additive Gaussian Encoding Space
- KERMIT: Generative Insertion-Based Modeling for Sequences
- Axial-DeepLab: Stand-Alone Axial-Attention for Panoptic Segmentation
- Recursive Recurrent Nets with Attention Modeling for OCR in the Wild
- Attention in Attention Network for Image Super-Resolution
- Person Search with Natural Language Description
- VideoLSTM Convolves, Attends and Flows for Action Recognition
- PAD-Net: Multi-Tasks Guided Prediction-and-Distillation Network for Simultaneous Depth Estimation and Scene Parsing
- Deep Unsupervised Saliency Detection: A Multiple Noisy Labeling Perspective
- Learning like a Child: Fast Novel Visual Concept Learning from Sentence Descriptions of Images
- Deep-Person: Learning Discriminative Deep Features for Person Re-Identification
- An Evaluation of Trajectory Prediction Approaches and Notes on the TrajNet Benchmark
- Deep Reinforcement Learning-based Image Captioning with Embedding Reward
- Spatial Transformer Networks
- Neural Attention for Image Captioning: Review of Outstanding Methods
- Show, Recall, and Tell: Image Captioning with Recall Mechanism
- Action-Attending Graphic Neural Network
- Pyramid Feature Attention Network for Saliency detection
- Multi-modal Deep Analysis for Multimedia
- DDGK: Learning Graph Representations for Deep Divergence Graph Kernels
- Contingency-Aware Exploration in Reinforcement Learning
- Superficial White Matter Analysis: An Efficient Point-cloud-based Deep Learning Framework with Supervised Contrastive Learning for Consistent Tractography Parcellation across Populations and dMRI Acquisitions
- Pervasive Attention: 2D Convolutional Neural Networks for Sequence-to-Sequence Prediction
- Reverse Attention for Salient Object Detection
- Context-Aware Embeddings for Automatic Art Analysis
- Behavioral Use Licensing for Responsible AI
- Learning Spatial Regularization with Image-level Supervisions for Multi-label Image Classification
- Learning Tasks for Multitask Learning: Heterogenous Patient Populations in the ICU
- Recurrent Batch Normalization
- A Survey on Transfer Learning in Natural Language Processing
- Talk2Nav: Long-Range Vision-and-Language Navigation with Dual Attention and Spatial Memory
- Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models
- Learning Deep Structure-Preserving Image-Text Embeddings
- Video Summarization with Attention-Based Encoder-Decoder Networks
- Learning to generalize to new compositions in image understanding
- ABCNN: Attention-Based Convolutional Neural Network for Modeling Sentence Pairs
- AlphaX: eXploring Neural Architectures with Deep Neural Networks and Monte Carlo Tree Search
- Modeling Context in Referring Expressions
- Predicting Temporal Sets with Deep Neural Networks
- GLAC Net: GLocal Attention Cascading Networks for Multi-image Cued Story Generation
- Modelling the Dynamic Joint Policy of Teammates with Attention Multi-agent DDPG
- Look, Listen and Learn - A Multimodal LSTM for Speaker Identification
- Multi-label Image Recognition by Recurrently Discovering Attentional Regions
- Dance Revolution: Long-Term Dance Generation with Music via Curriculum Learning
- Audio Caption: Listen and Tell
- Vision-to-Language Tasks Based on Attributes and Attention Mechanism
- Deep Cocktail Network: Multi-source Unsupervised Domain Adaptation with Category Shift
- Is Attention Better Than Matrix Decomposition?
- Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning
- Sequential Weakly Labeled Multi-Activity Localization and Recognition on Wearable Sensors using Recurrent Attention Networks
- First Step toward Model-Free, Anonymous Object Tracking with Recurrent Neural Networks
- Attention on Attention for Image Captioning
- Legal Judgment Prediction with Multi-Stage CaseRepresentation Learning in the Real Court Setting
- Diversity Regularized Spatiotemporal Attention for Video-based Person Re-identification
- Natural Language Understanding with Distributed Representation
- On End-to-End Program Generation from User Intention by Deep Neural Networks
- On the Binding Problem in Artificial Neural Networks
- DFTerNet: Towards 2-bit Dynamic Fusion Networks for Accurate Human Activity Recognition
- Trends in Integration of Vision and Language Research: A Survey of Tasks, Datasets, and Methods
- Large-Scale Image Retrieval with Attentive Deep Local Features
- AI-GAs: AI-generating algorithms, an alternate paradigm for producing general artificial intelligence
- Exploring Visual Relationship for Image Captioning
- TGIF: A New Dataset and Benchmark on Animated GIF Description
- Using Visual Analytics to Interpret Predictive Machine Learning Models
- Modality-Agnostic Attention Fusion for visual search with text feedback
- Stacked Cross Attention for Image-Text Matching
- Looking at Outfit to Parse Clothing
- LambdaNetworks: Modeling Long-Range Interactions Without Attention
- Video Storytelling: Textual Summaries for Events
- DiffNet++: A Neural Influence and Interest Diffusion Network for Social Recommendation
- Res3ATN -- Deep 3D Residual Attention Network for Hand Gesture Recognition in Videos
- Building a Large-scale Multimodal Knowledge Base System for Answering Visual Queries
- Object-driven Text-to-Image Synthesis via Adversarial Training
- Cross-Modal Self-Attention Network for Referring Image Segmentation
- Augmenting Self-attention with Persistent Memory
- On Interpretability of Artificial Neural Networks: A Survey
- Dual Attention Networks for Multimodal Reasoning and Matching
- Explain and Predict, and then Predict Again
- DeepProbe: Information Directed Sequence Understanding and Chatbot Design via Recurrent Neural Networks
- Accurate Single Stage Detector Using Recurrent Rolling Convolution
- Show, Attend and Read: A Simple and Strong Baseline for Irregular Text Recognition
- Neural Information Retrieval: A Literature Review
- Visual Question Answering: A Survey of Methods and Datasets
- Visual7W: Grounded Question Answering in Images
- Towards Robust Neural Networks via Random Self-ensemble
- Controlling Output Length in Neural Encoder-Decoders
- Attention-Aware Face Hallucination via Deep Reinforcement Learning
- DeepPhys: Video-Based Physiological Measurement Using Convolutional Attention Networks
- Delta Networks for Optimized Recurrent Network Computation
- A Multi-task Selected Learning Approach for Solving 3D Flexible Bin Packing Problem
- Cascaded Revision Network for Novel Object Captioning
- SRM : A Style-based Recalibration Module for Convolutional Neural Networks
- Uncovering Temporal Context for Video Question and Answering
- Rich Image Captioning in the Wild
- Attention-based Fully Gated CNN-BGRU for Russian Handwritten Text
- End-to-End Dense Video Captioning with Masked Transformer
- Fingerprint Presentation Attack Detection by Channel-wise Feature Denoising
- Dynamic Neural Networks: A Survey
- Explainable Artificial Intelligence (XAI): An Engineering Perspective
- Detecting Hate Speech in Multi-modal Memes
- Mixed High-Order Attention Network for Person Re-Identification
- Image Question Answering using Convolutional Neural Network with Dynamic Parameter Prediction
- Language as a Latent Variable: Discrete Generative Models for Sentence Compression
- Bidirectional Attentive Fusion with Context Gating for Dense Video Captioning
- Image Captioning with Very Scarce Supervised Data: Adversarial Semi-Supervised Learning Approach
- FcaNet: Frequency Channel Attention Networks
- Implicit Distortion and Fertility Models for Attention-based Encoder-Decoder NMT Model
- SCA-CNN: Spatial and Channel-wise Attention in Convolutional Networks for Image Captioning
- Reasoning About Pragmatics with Neural Listeners and Speakers
- Relation-Aware Global Attention for Person Re-identification
- An empirical study on the effectiveness of images in Multimodal Neural Machine Translation
- End-to-end Learning of Action Detection from Frame Glimpses in Videos
- Using Machine Learning Safely in Automotive Software: An Assessment and Adaption of Software Process Requirements in ISO 26262
- DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting
- Yin and Yang: Balancing and Answering Binary Visual Questions
- Dank Learning: Generating Memes Using Deep Neural Networks
- Image-based table recognition: data, model, and evaluation
- FVQA: Fact-based Visual Question Answering
- Saccader: Improving Accuracy of Hard Attention Models for Vision
- Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation
- Pragmatic inference and visual abstraction enable contextual flexibility during visual communication
- Skip RNN: Learning to Skip State Updates in Recurrent Neural Networks
- TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering
- DeepSpline: Data-Driven Reconstruction of Parametric Curves and Surfaces
- Comparative evaluation of CNN architectures for Image Caption Generation
- Latent Attention For If-Then Program Synthesis
- Multilingual NMT with a language-independent attention bridge
- 3G structure for image caption generation
- A Survey of Natural Language Generation Techniques with a Focus on Dialogue Systems - Past, Present and Future Directions
- Kronecker Attention Networks
- STING: Self-attention based Time-series Imputation Networks using GAN
- Mimic and Fool: A Task Agnostic Adversarial Attack
- Multimodal Unified Attention Networks for Vision-and-Language Interactions
- Deep Verifier Networks: Verification of Deep Discriminative Models with Deep Generative Models
- Multi-modality Latent Interaction Network for Visual Question Answering
- An Empirical Study on Leveraging Scene Graphs for Visual Question Answering
- Attention Branch Network: Learning of Attention Mechanism for Visual Explanation
- A Neural Compositional Paradigm for Image Captioning
- What value do explicit high level concepts have in vision to language problems?
- SR-LSTM: State Refinement for LSTM towards Pedestrian Trajectory Prediction
- Exploring Self-attention for Image Recognition
- Beating Atari with Natural Language Guided Reinforcement Learning
- Learning Better Features for Face Detection with Feature Fusion and Segmentation Supervision
- Variational Context: Exploiting Visual and Textual Context for Grounding Referring Expressions
- Multi-View Self-Attention for Interpretable Drug-Target Interaction Prediction
- Learning to Read Chest X-Rays: Recurrent Neural Cascade Model for Automated Image Annotation
- Incorporating Copying Mechanism in Image Captioning for Learning Novel Objects
- On Distinctive Image Captioning via Comparing and Reweighting
- Improving Natural Language Processing Tasks with Human Gaze-Guided Neural Attention
- SentiCap: Generating Image Descriptions with Sentiments
- Sentence Specified Dynamic Video Thumbnail Generation
- Character-Based Handwritten Text Transcription with Attention Networks
- Deep Feature Mining via Attention-based BiLSTM-GCN for Human Motor Imagery Recognition
- Uncertainty-Aware Attention for Reliable Interpretation and Prediction
- Creativity: Generating Diverse Questions using Variational Autoencoders
- Dynamic Dual-Attentive Aggregation Learning for Visible-Infrared Person Re-Identification
- Detecting Statistical Interactions from Neural Network Weights
- Adaptive Dependency Learning Graph Neural Networks
- Granger-causal Attentive Mixtures of Experts: Learning Important Features with Neural Networks
- UntrimmedNets for Weakly Supervised Action Recognition and Detection
- It Takes Two to Tango: Towards Theory of AI's Mind
- Attentive Group Equivariant Convolutional Networks
- Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators
- CLAMP: Prompt-based Contrastive Learning for Connecting Language and Animal Pose
- Arcades: A deep model for adaptive decision making in voice controlled smart-home
- SOS: Selective Objective Switch for Rapid Immunofluorescence Whole Slide Image Classification
- Show, Adapt and Tell: Adversarial Training of Cross-domain Image Captioner
- Show, Attend and Interact: Perceivable Human-Robot Social Interaction through Neural Attention Q-Network
- Generative Concatenative Nets Jointly Learn to Write and Classify Reviews
- Semantic Object Parsing with Local-Global Long Short-Term Memory
- Discrete and continuous representations and processing in deep learning: Looking forward
- Image Captioning with Deep Bidirectional LSTMs
- Multi-focus Attention Network for Efficient Deep Reinforcement Learning
- Contextualize, Show and Tell: A Neural Visual Storyteller
- Segmentation from Natural Language Expressions
- Learning to Answer Questions From Image Using Convolutional Neural Network
- RepsNet: Combining Vision with Language for Automated Medical Reports
- Inseq: An Interpretability Toolkit for Sequence Generation Models
- pix2code: Generating Code from a Graphical User Interface Screenshot
- Scene Graph Generation from Objects, Phrases and Region Captions
- Machine Reading Comprehension: a Literature Review
- Improving Image Captioning with Better Use of Captions
- Signed Distance-based Deep Memory Recommender
- Leveraging Knowledge Bases in LSTMs for Improving Machine Reading
- DeepSignals: Predicting Intent of Drivers Through Visual Signals
- Multi-step Reasoning via Recurrent Dual Attention for Visual Dialog
- Context-Aware Self-Attention Networks
- Transforming Visual Scene Graphs to Image Captions
- Natural Language Generation in Dialogue using Lexicalized and Delexicalized Data
- Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language Feedback
- Vehicle Attribute Recognition by Appearance: Computer Vision Methods for Vehicle Type, Make and Model Classification
- Regularizing RNNs for Caption Generation by Reconstructing The Past with The Present
- MusCaps: Generating Captions for Music Audio
- Deep Learning with a Rethinking Structure for Multi-label Classification
- DVQA: Understanding Data Visualizations via Question Answering
- Low-Resource Text Classification using Domain-Adversarial Learning
- Understanding Hidden Memories of Recurrent Neural Networks
- Structured Attentions for Visual Question Answering
- Natural Language Object Retrieval
- Towards Interpretable Reinforcement Learning Using Attention Augmented Agents
- Transcribing Content from Structural Images with Spotlight Mechanism
- Auto-Encoding Scene Graphs for Image Captioning
- Less Is More: Picking Informative Frames for Video Captioning
- Text Detection and Recognition in the Wild: A Review
- Partially-Supervised Image Captioning
- Generating Radiology Reports via Memory-driven Transformer
- Higher-order Graph Convolutional Networks
- Real-Time Referring Expression Comprehension by Single-Stage Grounding Network
- Unpaired Image Captioning via Scene Graph Alignments
- Chest ImaGenome Dataset for Clinical Reasoning
- ARGAN: Attentive Recurrent Generative Adversarial Network for Shadow Detection and Removal
- CNN Attention Guidance for Improved Orthopedics Radiographic Fracture Classification
- CgT-GAN: CLIP-guided Text GAN for Image Captioning
- Normalized and Geometry-Aware Self-Attention Network for Image Captioning
- VQS: Linking Segmentations to Questions and Answers for Supervised Attention in VQA and Question-Focused Semantic Segmentation
- Attention Based Glaucoma Detection: A Large-scale Database and CNN Model
- Diverse Image Captioning with Context-Object Split Latent Spaces
- TVQA+: Spatio-Temporal Grounding for Video Question Answering
- Masked Non-Autoregressive Image Captioning
- Deep Sequence Modeling: Development and Applications in Asset Pricing
- Image-Conditioned Graph Generation for Road Network Extraction
- Reasoning Visual Dialogs with Structural and Partial Observations
- Style Mixer: Semantic-aware Multi-Style Transfer Network
- Audio Visual Emotion Recognition with Temporal Alignment and Perception Attention
- Saliency Prediction in the Deep Learning Era: Successes, Limitations, and Future Challenges
- Spatio-Temporal Attention Models for Grounded Video Captioning
- Context-aware Captions from Context-agnostic Supervision
- Improving Referring Expression Grounding with Cross-modal Attention-guided Erasing
- Dual-Level Collaborative Transformer for Image Captioning
- PS-DeVCEM: Pathology-sensitive deep learning model for video capsule endoscopy based on weakly labeled data
- Spatially Adaptive Computation Time for Residual Networks
- Improving Sequence-to-Sequence Learning via Optimal Transport
- Learning with hidden variables
- Natural Language Guided Visual Relationship Detection
- End-to-End Supermask Pruning: Learning to Prune Image Captioning Models
- Pick-Object-Attack: Type-Specific Adversarial Attack for Object Detection
- Neural Language Generation: Formulation, Methods, and Evaluation
- MemexQA: Visual Memex Question Answering
- Informative Visual Storytelling with Cross-modal Rules
- Quantitative Phase Imaging and Artificial Intelligence: A Review
- Attention-Based Multimodal Fusion for Video Description
- Egocentric Image Captioning for Privacy-Preserved Passive Dietary Intake Monitoring
- Imputer: Sequence Modelling via Imputation and Dynamic Programming
- MUREL: Multimodal Relational Reasoning for Visual Question Answering
- Explaining Deep Neural Networks
- Say As You Wish: Fine-grained Control of Image Caption Generation with Abstract Scene Graphs
- Mechanisms of a Convolutional Neural Network for Learning Three-dimensional Unsteady Wake Flow
- Situation Recognition with Graph Neural Networks
- Look Before You Leap: Bridging Model-Free and Model-Based Reinforcement Learning for Planned-Ahead Vision-and-Language Navigation
- Polysemous Visual-Semantic Embedding for Cross-Modal Retrieval
- Textual Entailment with Structured Attentions and Composition
- Extreme Multi-Label Legal Text Classification: A case study in EU Legislation
- Question-Guided Hybrid Convolution for Visual Question Answering
- Sequential Image-based Attention Network for Inferring Force Estimation without Haptic Sensor
- Experiment Segmentation in Scientific Discourse as Clause-level Structured Prediction using Recurrent Neural Networks
- Rethinking the Reference-based Distinctive Image Captioning
- SEQ^3: Differentiable Sequence-to-Sequence-to-Sequence Autoencoder for Unsupervised Abstractive Sentence Compression
- Producing radiologist-quality reports for interpretable artificial intelligence
- MultiBench: Multiscale Benchmarks for Multimodal Representation Learning
- ORDNet: Capturing Omni-Range Dependencies for Scene Parsing
- Task-driven Visual Saliency and Attention-based Visual Question Answering
- Auxiliary Signal-Guided Knowledge Encoder-Decoder for Medical Report Generation
- Embedding API Dependency Graph for Neural Code Generation
- Attention on Attention: Architectures for Visual Question Answering (VQA)
- ViTAA: Visual-Textual Attributes Alignment in Person Search by Natural Language
- Deep Learning in Bioinformatics
- Multimodal Attention Branch Network for Perspective-Free Sentence Generation
- Exploring and Distilling Posterior and Prior Knowledge for Radiology Report Generation
- Attention-based Dropout Layer for Weakly Supervised Object Localization
- An Extreme-Adaptive Time Series Prediction Model Based on Probability-Enhanced LSTM Neural Networks
- Weakly-supervised Visual Grounding of Phrases with Linguistic Structures
- Wind Park Power Prediction: Attention-Based Graph Networks and Deep Learning to Capture Wake Losses
- Agreement-based Joint Training for Bidirectional Attention-based Neural Machine Translation
- MAMNet: Multi-path Adaptive Modulation Network for Image Super-Resolution
- Multi-Agent Game Abstraction via Graph Attention Neural Network
- Pose-aware Multi-level Feature Network for Human Object Interaction Detection
- Vispi: Automatic Visual Perception and Interpretation of Chest X-rays
- Channel-wise and Spatial Feature Modulation Network for Single Image Super-Resolution
- ICECAP: Information Concentrated Entity-aware Image Captioning
- Distilling Knowledge Learned in BERT for Text Generation
- Automatic Radiology Report Generation based on Multi-view Image Fusion and Medical Concept Enrichment
- Highrisk Prediction from Electronic Medical Records via Deep Attention Networks
- Language and Visual Entity Relationship Graph for Agent Navigation
- Review of end-to-end speech synthesis technology based on deep learning
- Tackling the Unannotated: Scene Graph Generation with Bias-Reduced Models
- Learning Wake-Sleep Recurrent Attention Models
- Counterfactual Critic Multi-Agent Training for Scene Graph Generation
- Learning Social Image Embedding with Deep Multimodal Attention Networks
- Relational Collaborative Filtering:Modeling Multiple Item Relations for Recommendation
- Neural Person Search Machines
- ACDC: A Structured Efficient Linear Layer
- Pose-adaptive Hierarchical Attention Network for Facial Expression Recognition
- Sketch-R2CNN: An Attentive Network for Vector Sketch Recognition
- Embodied Vision-and-Language Navigation with Dynamic Convolutional Filters
- Similar Scenes arouse Similar Emotions: Parallel Data Augmentation for Stylized Image Captioning
- On Generalization Bounds of a Family of Recurrent Neural Networks
- Watch What You Just Said: Image Captioning with Text-Conditional Attention
- Soft + Hardwired Attention: An LSTM Framework for Human Trajectory Prediction and Abnormal Event Detection
- GuessWhat?! Visual object discovery through multi-modal dialogue
- Attacking Visual Language Grounding with Adversarial Examples: A Case Study on Neural Image Captioning
- Cardiac Segmentation on CT Images through Shape-Aware Contour Attentions
- Phase Conductor on Multi-layered Attentions for Machine Comprehension
- Entropy-Enhanced Multimodal Attention Model for Scene-Aware Dialogue Generation
- Learning to Collocate Neural Modules for Image Captioning
- improving partition-block-based acoustic echo canceler in under-modeling scenarios
- From handcrafted to deep local features
- Contrastive Visual-Linguistic Pretraining
- Learning Category Correlations for Multi-label Image Recognition with Graph Networks
- Improving Image Captioning by Leveraging Intra- and Inter-layer Global Representation in Transformer Network
- Scene Graph Generation via Conditional Random Fields
- Semantic Compositional Networks for Visual Captioning
- Dynamic Computational Time for Visual Attention
- In Defense of Grid Features for Visual Question Answering
- Describing like humans: on diversity in image captioning
- Speech-Image Semantic Alignment Does Not Depend on Any Prior Classification Tasks
- Referring Relationships
- Conditional Generative Neural System for Probabilistic Trajectory Prediction
- Contrastive Attention for Automatic Chest X-ray Report Generation
- Focus Your Attention: A Bidirectional Focal Attention Network for Image-Text Matching
- Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering
- Hierarchical LSTMs with Adaptive Attention for Visual Captioning
- M2GNN: Metapath and Multi-interest Aggregated Graph Neural Network for Tag-based Cross-domain Recommendation
- Attention-based Temporal Weighted Convolutional Neural Network for Action Recognition
- Repurposing Existing Deep Networks for Caption and Aesthetic-Guided Image Cropping
- BreakingNews: Article Annotation by Image and Text Processing
- HashGAN:Attention-aware Deep Adversarial Hashing for Cross Modal Retrieval
- Position Focused Attention Network for Image-Text Matching
- Improving Interpretability of Deep Neural Networks with Semantic Information
- Learning to Focus: Cascaded Feature Matching Network for Few-shot Image Recognition
- Motion Guided Attention for Video Salient Object Detection
- SVAM: Saliency-guided Visual Attention Modeling by Autonomous Underwater Robots
- Co-Attentive Equivariant Neural Networks: Focusing Equivariance On Transformations Co-Occurring In Data
- Revisiting Image-Language Networks for Open-ended Phrase Detection
- Generating Descriptions with Grounded and Co-Referenced People
- Neural Discourse Relation Recognition with Semantic Memory
- Financial series prediction using Attention LSTM
- Multi-Label Image Classification with Contrastive Learning
- Saliency-Guided Attention Network for Image-Sentence Matching
- A scalable saliency-based Feature selection method with instance level information
- VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
- RANDOM MASK: Towards Robust Convolutional Neural Networks
- Skeleton Key: Image Captioning by Skeleton-Attribute Decomposition
- Memory-Attended Recurrent Network for Video Captioning
- Bidirectional Long-Short Term Memory for Video Description
- Attention Optimization for Abstractive Document Summarization
- Simple and Effective Curriculum Pointer-Generator Networks for Reading Comprehension over Long Narratives
- An Attempt towards Interpretable Audio-Visual Video Captioning
- Convolutional Attention Networks for Multimodal Emotion Recognition from Speech and Text Data
- Neural Machine Translation with Latent Semantic of Image and Text
- VQA-E: Explaining, Elaborating, and Enhancing Your Answers for Visual Questions
- Interact as You Intend: Intention-Driven Human-Object Interaction Detection
- Can Active Memory Replace Attention?
- Deep Kernel Learning
- Sliced Recurrent Neural Networks
- Face2Text: Collecting an Annotated Image Description Corpus for the Generation of Rich Face Descriptions
- Multimodal Grounding for Language Processing
- Learning to Evaluate Image Captioning
- Neural Sign Language Translation based on Human Keypoint Estimation
- Aspect-based Sentiment Classification with Aspect-specific Graph Convolutional Networks
- Visual Question Answering with Memory-Augmented Networks
- Dynamic Deep Neural Networks: Optimizing Accuracy-Efficiency Trade-offs by Selective Execution
- Causal Inference in Natural Language Processing: Estimation, Prediction, Interpretation and Beyond
- Inductive Biases and Variable Creation in Self-Attention Mechanisms
- Video Fill in the Blank with Merging LSTMs
- LSTMVis: A Tool for Visual Analysis of Hidden State Dynamics in Recurrent Neural Networks
- Fusion Models for Improved Visual Captioning
- GraphGLOW: Universal and Generalizable Structure Learning for Graph Neural Networks
- Box-driven Class-wise Region Masking and Filling Rate Guided Loss for Weakly Supervised Semantic Segmentation
- DeepNovoV2: Better de novo peptide sequencing with deep learning
- Reinforcement Learning for Learning Rate Control
- Plasma Confinement Mode Classification Using a Sequence-to-Sequence Neural Network With Attention
- AReLU: Attention-based Rectified Linear Unit
- Deep Learning Methods for Vessel Trajectory Prediction based on Recurrent Neural Networks
- Correlated and Individual Multi-Modal Deep Learning for RGB-D Object Recognition
- SAC: Accelerating and Structuring Self-Attention via Sparse Adaptive Connection
- Learning Visual Knowledge Memory Networks for Visual Question Answering
- Cross Domain Knowledge Transfer for Person Re-identification
- Re-evaluating Automatic Metrics for Image Captioning
- PSGAN: Pose and Expression Robust Spatial-Aware GAN for Customizable Makeup Transfer
- Linguistically-aware Attention for Reducing the Semantic-Gap in Vision-Language Tasks
- Improving Multimodal Accuracy Through Modality Pre-training and Attention
- The YouTube-8M Kaggle Competition: Challenges and Methods
- NODE-GAM: Neural Generalized Additive Model for Interpretable Deep Learning
- SCAN: A Scalable Neural Networks Framework Towards Compact and Efficient Models
- Attributed Sequence Embedding
- Persona-Aware Tips Generation
- Structured Reordering for Modeling Latent Alignments in Sequence Transduction
- VisualGPT: Data-efficient Adaptation of Pretrained Language Models for Image Captioning
- Frame-Recurrent Video Inpainting by Robust Optical Flow Inference
- Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays
- Learning to Generate with Memory
- SBNet: Sparse Blocks Network for Fast Inference
- Techniques for visualizing LSTMs applied to electrocardiograms
- Recurrent Attentional Reinforcement Learning for Multi-label Image Recognition
- Comprehensive Image Captioning via Scene Graph Decomposition
- Learn to Interpret Atari Agents
- MultiCapCLIP: Auto-Encoding Prompts for Zero-Shot Multilingual Visual Captioning
- Synergistic Learning of Lung Lobe Segmentation and Hierarchical Multi-Instance Classification for Automated Severity Assessment of COVID-19 in CT Images
- Dual-interest Factorization-heads Attention for Sequential Recommendation
- A Survey on Biomedical Image Captioning
- Visual Relationship Detection using Scene Graphs: A Survey
- Motion Prediction Under Multimodality with Conditional Stochastic Networks
- Factor Graph Attention
- A Semi-supervised Framework for Image Captioning
- Cross-Modal Graph with Meta Concepts for Video Captioning
- Tell-and-Answer: Towards Explainable Visual Question Answering using Attributes and Captions
- Learning Intra-Batch Connections for Deep Metric Learning
- CSVideoNet: A Real-time End-to-end Learning Framework for High-frame-rate Video Compressive Sensing
- RobustScanner: Dynamically Enhancing Positional Clues for Robust Text Recognition
- Knowledge Squeezed Adversarial Network Compression
- Fast Convergence of DETR with Spatially Modulated Co-Attention
- End-to-end Video-level Representation Learning for Action Recognition
- Visual Saliency Maps Can Apply to Facial Expression Recognition
- Causal Interpretability for Machine Learning -- Problems, Methods and Evaluation
- Textual Explanations for Self-Driving Vehicles
- StereoNet: Guided Hierarchical Refinement for Real-Time Edge-Aware Depth Prediction
- CoDraw: Collaborative Drawing as a Testbed for Grounded Goal-driven Communication
- Modulating and attending the source image during encoding improves Multimodal Translation
- Understanding Visual Ads by Aligning Symbols and Objects using Co-Attention
- ClipCap: CLIP Prefix for Image Captioning
- Improving performance and inference on audio classification tasks using capsule networks
- Sequential Interpretability: Methods, Applications, and Future Direction for Understanding Deep Learning Models in the Context of Sequential Data
- LEAF-QA: Locate, Encode & Attend for Figure Question Answering
- Convolutional Auto-encoding of Sentence Topics for Image Paragraph Generation
- Improving Description-based Person Re-identification by Multi-granularity Image-text Alignments
- Recurrence along Depth: Deep Convolutional Neural Networks with Recurrent Layer Aggregation
- AEI: Actors-Environment Interaction with Adaptive Attention for Temporal Action Proposals Generation
- Dual Attention Networks for Visual Reference Resolution in Visual Dialog
- FeaStNet: Feature-Steered Graph Convolutions for 3D Shape Analysis
- An Empirical Investigation into the Use of Image Captioning for Automated Software Documentation
- Reflective-Net: Learning from Explanations
- Steering Output Style and Topic in Neural Response Generation
- Text2Scene: Generating Compositional Scenes from Textual Descriptions
- Towards Interpretable R-CNN by Unfolding Latent Structures
- Multimodal Machine Translation with Reinforcement Learning
- FTGAN: A Fully-trained Generative Adversarial Networks for Text to Face Generation
- Predicting Shot Making in Basketball Learnt from Adversarial Multiagent Trajectories
- Fast, Diverse and Accurate Image Captioning Guided By Part-of-Speech
- Improving the Performance of Neural Machine Translation Involving Morphologically Rich Languages
- Temporal Difference Variational Auto-Encoder
- Hierarchical Opacity Propagation for Image Matting
- Sketch Less for More: On-the-Fly Fine-Grained Sketch Based Image Retrieval
- Attention-aware Multi-stroke Style Transfer
- Deep Reasoning with Multi-Scale Context for Salient Object Detection
- End-to-End Localization and Ranking for Relative Attributes
- More Grounded Image Captioning by Distilling Image-Text Matching Model
- Hyperspectral Image Classification with Attention Aided CNNs
- More Photos are All You Need: Semi-Supervised Learning for Fine-Grained Sketch Based Image Retrieval
- Contextual Dropout: An Efficient Sample-Dependent Dropout Module
- Attended End-to-end Architecture for Age Estimation from Facial Expression Videos
- Sentence Simplification with Deep Reinforcement Learning
- Aspect-augmented Adversarial Networks for Domain Adaptation
- Heterogeneous Graph Attention Network
- Improving the Performance of Automated Audio Captioning via Integrating the Acoustic and Semantic Information
- Augmenting Decompiler Output with Learned Variable Names and Types
- Visual-Semantic Transformer for Scene Text Recognition
- Reversible Recursive Instance-level Object Segmentation
- VizADS-B: Analyzing Sequences of ADS-B Images Using Explainable Convolutional LSTM Encoder-Decoder to Detect Cyber Attacks
- The Role of Context Selection in Object Detection
- Cascaded Text Generation with Markov Transformers
- Adversarially Regularized Graph Attention Networks for Inductive Learning on Partially Labeled Graphs
- X-Linear Attention Networks for Image Captioning
- Learning Visual Storylines with Skipping Recurrent Neural Networks
- Learning Transferrable Knowledge for Semantic Segmentation with Deep Convolutional Neural Network
- Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking
- Fashion Captioning: Towards Generating Accurate Descriptions with Semantic Rewards
- Incremental Text to Speech for Neural Sequence-to-Sequence Models using Reinforcement Learning
- Hard-Attention for Scalable Image Classification
- Senti-Attend: Image Captioning using Sentiment and Attention
- Compositional Generalization for Primitive Substitutions
- ACNe: Attentive Context Normalization for Robust Permutation-Equivariant Learning
- Cuttlefish: A Lightweight Primitive for Adaptive Query Processing
- Learning Online Alignments with Continuous Rewards Policy Gradient
- Unpaired Image Captioning by Language Pivoting
- The Spatially-Correlative Loss for Various Image Translation Tasks
- Neural Architecture Search using Deep Neural Networks and Monte Carlo Tree Search
- N-ImageNet: Towards Robust, Fine-Grained Object Recognition with Event Cameras
- Sparse Attentive Memory Network for Click-through Rate Prediction with Long Sequences
- Vision and Language: from Visual Perception to Content Creation
- Learning Where to Focus for Efficient Video Object Detection
- Deep Multimodal Neural Architecture Search
- FoveaNet: Perspective-aware Urban Scene Parsing
- ContCap: A scalable framework for continual image captioning
- Attention-based Multi-instance Neural Network for Medical Diagnosis from Incomplete and Low Quality Data
- Connecting Touch and Vision via Cross-Modal Prediction
- See, Attend and Brake: An Attention-based Saliency Map Prediction Model for End-to-End Driving
- From genome to phenome: Predicting multiple cancer phenotypes based on somatic genomic alterations via the genomic impact transformer
- Teacher-Critical Training Strategies for Image Captioning
- Title Generation for User Generated Videos
- Information Maximizing Visual Question Generation
- Audio Captioning using Gated Recurrent Units
- Two Causal Principles for Improving Visual Dialog
- Finding and Visualizing Weaknesses of Deep Reinforcement Learning Agents
- LCEval: Learned Composite Metric for Caption Evaluation
- Benign Shortcut for Debiasing: Fair Visual Recognition via Intervention with Shortcut Features
- Crowd Counting Using Scale-Aware Attention Networks
- Matching Visual Features to Hierarchical Semantic Topics for Image Paragraph Captioning
- Stacked Cross-modal Feature Consolidation Attention Networks for Image Captioning
- Collaborative Attention Mechanism for Multi-View Action Recognition
- Rethinking Irregular Scene Text Recognition
- Sensor-Augmented Egocentric-Video Captioning with Dynamic Modal Attention
- Hierarchical Text Classification As Sub-Hierarchy Sequence Generation
- Atlas: A Dataset and Benchmark for E-commerce Clothing Product Categorization
- MOrdReD: Memory-based Ordinal Regression Deep Neural Networks for Time Series Forecasting
- Compact Global Descriptor for Neural Networks
- Learning Visual Question Answering by Bootstrapping Hard Attention
- Lessons learned developing and using a machine learning model to automatically transcribe 2.3 million handwritten occupation codes
- "Factual" or "Emotional": Stylized Image Captioning with Adaptive Learning and Attention
- CORAL8: Concurrent Object Regression for Area Localization in Medical Image Panels
- AutoCaption: Image Captioning with Neural Architecture Search
- GASL: Guided Attention for Sparsity Learning in Deep Neural Networks
- Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video
- IMG2SMI: Translating Molecular Structure Images to Simplified Molecular-input Line-entry System
- Machine Translation: A Literature Review
- Translating Math Formula Images to LaTeX Sequences Using Deep Neural Networks with Sequence-level Training
- A Comprehensive Study on Medical Image Segmentation using Deep Neural Networks
- Pyramid Multi-view Stereo Net with Self-adaptive View Aggregation
- Handwritten Mathematical Expression Recognition with Bidirectionally Trained Transformer
- Deep Collaborative Filtering with Multi-Aspect Information in Heterogeneous Networks
- Learning Similarity Conditions Without Explicit Supervision
- DFPENet-geology: A Deep Learning Framework for High Precision Recognition and Segmentation of Co-seismic Landslides
- CAGAN: Text-To-Image Generation with Combined Attention GANs
- Transform and Tell: Entity-Aware News Image Captioning
- Sub-Instruction Aware Vision-and-Language Navigation
- Attending to Discriminative Certainty for Domain Adaptation
- Why an Android App is Classified as Malware? Towards Malware Classification Interpretation
- Question Type Guided Attention in Visual Question Answering
- Dense Captioning with Joint Inference and Visual Context
- Instance-aware Image and Sentence Matching with Selective Multimodal LSTM
- Generating captions without looking beyond objects
- Recognizing Handwritten Mathematical Expressions as LaTex Sequences Using a Multiscale Robust Neural Network
- MAST: A Memory-Augmented Self-supervised Tracker
- A Real-time Global Inference Network for One-stage Referring Expression Comprehension
- Few-shot Video-to-Video Synthesis
- Gated Hierarchical Attention for Image Captioning
- Deep Attentive Tracking via Reciprocative Learning
- Leveraging Bottom-Up and Top-Down Attention for Few-Shot Object Detection
- Visually Grounded Word Embeddings and Richer Visual Features for Improving Multimodal Neural Machine Translation
- ReFormer: The Relational Transformer for Image Captioning
- Aesthetic-Driven Image Enhancement by Adversarial Learning
- Referring Expression Object Segmentation with Caption-Aware Consistency
- Improving Deep Visual Representation for Person Re-identification by Global and Local Image-language Association
- Room for improvement in automatic image description: an error analysis
- Learning to Act Properly: Predicting and Explaining Affordances from Images
- Adding Attentiveness to the Neurons in Recurrent Neural Networks
- SceneGraphFusion: Incremental 3D Scene Graph Prediction from RGB-D Sequences
- DF^2AM: Dual-level Feature Fusion and Affinity Modeling for RGB-Infrared Cross-modality Person Re-identification
- Fine-Grained Image Captioning with Global-Local Discriminative Objective
- Exact Adversarial Attack to Image Captioning via Structured Output Learning with Latent Variables
- Attention and Localization based on a Deep Convolutional Recurrent Model for Weakly Supervised Audio Tagging
- Understanding Image and Text Simultaneously: a Dual Vision-Language Machine Comprehension Task
- Deep Quantization: Encoding Convolutional Activations with Deep Generative Model
- Dense Recurrent Neural Networks for Scene Labeling
- Melody Generation for Pop Music via Word Representation of Musical Properties
- Deep Binaries: Encoding Semantic-Rich Cues for Efficient Textual-Visual Cross Retrieval
- Dual-Glance Model for Deciphering Social Relationships
- Temporally Coherent Full 3D Mesh Human Pose Recovery from Monocular Video
- Sparse Sequence-to-Sequence Models
- Figure Captioning with Reasoning and Sequence-Level Training
- Streamlined Dense Video Captioning
- Context Aware Machine Learning
- CAUSE: Learning Granger Causality from Event Sequences using Attribution Methods
- L3DOC: Lifelong 3D Object Classification
- Zero-Shot Reinforcement Learning with Deep Attention Convolutional Neural Networks
- Multi-grained Attention Networks for Single Image Super-Resolution
- MeLIME: Meaningful Local Explanation for Machine Learning Models
- Self-Segregating and Coordinated-Segregating Transformer for Focused Deep Multi-Modular Network for Visual Question Answering
- The Variational Bandwidth Bottleneck: Stochastic Evaluation on an Information Budget
- ParaCNN: Visual Paragraph Generation via Adversarial Twin Contextual CNNs
- Pose Recognition with Cascade Transformers
- A study of latent monotonic attention variants
- Fast Sequence Generation with Multi-Agent Reinforcement Learning
- Describing image focused in cognitive and visual details for visually impaired people: An approach to generating inclusive paragraphs
- A Multi-task Learning Framework for Drone State Identification and Trajectory Prediction
- MissFormer: (In-)attention-based handling of missing observations for trajectory filtering and prediction
- End-to-End Attention-based Image Captioning
- Parallax Attention for Unsupervised Stereo Correspondence Learning
- Gated Channel Transformation for Visual Recognition
- Curiosity-driven Reinforcement Learning for Diverse Visual Paragraph Generation
- Towards Diverse and Accurate Image Captions via Reinforcing Determinantal Point Process
- Robust Sequence-to-Sequence Acoustic Modeling with Stepwise Monotonic Attention for Neural TTS
- Dense Relational Captioning: Triple-Stream Networks for Relationship-Based Captioning
- Generative Visual Dialogue System via Adaptive Reasoning and Weighted Likelihood Estimation
- On transfer learning using a MAC model variant
- Relational Long Short-Term Memory for Video Action Recognition
- Image Captioning Based on a Hierarchical Attention Mechanism and Policy Gradient Optimization
- Move Forward and Tell: A Progressive Generator of Video Descriptions
- A Two-Stream Mutual Attention Network for Semi-supervised Biomedical Segmentation with Noisy Labels
- Pose-Based Two-Stream Relational Networks for Action Recognition in Videos
- Towards Interpretable Face Recognition
- Feature Selective Small Object Detection via Knowledge-based Recurrent Attentive Neural Network
- Fourier Policy Gradients
- CAR-Net: Clairvoyant Attentive Recurrent Network
- DeepPicker: a Deep Learning Approach for Fully Automated Particle Picking in Cryo-EM
- Semantic Object Parsing with Graph LSTM
- Long Short-Term Attention
- Set-to-Sequence Methods in Machine Learning: a Review
- Image Captioning based on Deep Learning Methods: A Survey
- Finding It at Another Side: A Viewpoint-Adapted Matching Encoder for Change Captioning
- Hide-and-Seek: A Template for Explainable AI
- Top-down Visual Saliency Guided by Captions
- Towards Precise End-to-end Weakly Supervised Object Detection Network
- Exploring Overall Contextual Information for Image Captioning in Human-Like Cognitive Style
- Explainable Object-induced Action Decision for Autonomous Vehicles
- Attention-based Image Upsampling
- "How Does It Detect A Malicious App?" Explaining the Predictions of AI-based Android Malware Detector
- A Planning based Framework for Essay Generation
- Delving Deeper into the Decoder for Video Captioning
- Conditional Text Generation for Harmonious Human-Machine Interaction
- A Novel Fusion of Attention and Sequence to Sequence Autoencoders to Predict Sleepiness From Speech
- A3GAN: An Attribute-aware Attentive Generative Adversarial Network for Face Aging
- Towards General Purpose Vision Systems
- Explanatory machine learning for sequential human teaching
- Sparse Graph Attention Networks
- Multimodal Generative Models for Compositional Representation Learning
- Hybrid-Attention based Decoupled Metric Learning for Zero-Shot Image Retrieval
- Energy-Based Models for Continual Learning
- Transformer-based Network for RGB-D Saliency Detection
- CaEGCN: Cross-Attention Fusion based Enhanced Graph Convolutional Network for Clustering
- Recurrent Neural Networks for P300-based BCI
- Visual News: Benchmark and Challenges in News Image Captioning
- Image Classification for Arabic: Assessing the Accuracy of Direct English to Arabic Translations
- Object Based Attention Through Internal Gating
- End-to-End Video Captioning with Multitask Reinforcement Learning
- Multi-level Multimodal Common Semantic Space for Image-Phrase Grounding
- Dense Image Representation with Spatial Pyramid VLAD Coding of CNN for Locally Robust Captioning
- Learning to Learn Relation for Important People Detection in Still Images
- Listen carefully and tell: an audio captioning system based on residual learning and gammatone audio representation
- Stroke Constrained Attention Network for Online Handwritten Mathematical Expression Recognition
- Reflective Decoding Network for Image Captioning
- Large-scale Video Classification guided by Batch Normalized LSTM Translator
- Transferring Domain-Agnostic Knowledge in Video Question Answering
- Identifying Sub-Phenotypes of Acute Kidney Injury using Structured and Unstructured Electronic Health Record Data with Memory Networks
- Attend in groups: a weakly-supervised deep learning framework for learning from web data
- CaseNet: Content-Adaptive Scale Interaction Networks for Scene Parsing
- Transformers for Limit Order Books
- Journalistic Guidelines Aware News Image Captioning
- Action Classification and Highlighting in Videos
- Person Re-identification Using Visual Attention
- DeepRemaster: Temporal Source-Reference Attention Networks for Comprehensive Video Enhancement
- Cross-modality Discrepant Interaction Network for RGB-D Salient Object Detection
- An Attention-Based Approach for Single Image Super Resolution
- Uncertainty-Aware Deep Calibrated Salient Object Detection
- Transferable Representation Learning in Vision-and-Language Navigation
- Unsupervised Data Uncertainty Learning in Visual Retrieval Systems
- Informative Image Captioning with External Sources of Information
- Notes on Deep Learning for NLP
- Attention-GAN for Object Transfiguration in Wild Images
- Periphery-Fovea Multi-Resolution Driving Model guided by Human Attention
- Better Captioning with Sequence-Level Exploration
- Knowledge-driven Encode, Retrieve, Paraphrase for Medical Image Report Generation
- How To Evaluate Your Dialogue System: Probe Tasks as an Alternative for Token-level Evaluation Metrics
- Convolutional Neural Network(CNN/ConvNet) in Stock Price Movement Prediction
- Primitive Representation Learning for Scene Text Recognition
- The Costs and Benefits of Goal-Directed Attention in Deep Convolutional Neural Networks
- Active Visual Information Gathering for Vision-Language Navigation
- Neural Message Passing for Multi-Label Classification
- End-to-End Spoken Language Translation
- Dual Contrastive Loss and Attention for GANs
- Multimodal Learning for Hateful Memes Detection
- Causal Attention for Vision-Language Tasks
- MQTransformer: Multi-Horizon Forecasts with Context Dependent and Feedback-Aware Attention
- A Study of the Plausibility of Attention between RNN Encoders in Natural Language Inference
- Weakly supervised cross-domain alignment with optimal transport
- Self-Supervised Image-to-Text and Text-to-Image Synthesis
- Explainable Deep Relational Networks for Predicting Compound-Protein Affinities and Contacts
- Benchmarking Deep Sequential Models on Volatility Predictions for Financial Time Series
- Modeling Taxi Drivers' Behaviour for the Next Destination Prediction
- Tracking by Animation: Unsupervised Learning of Multi-Object Attentive Trackers
- Visual Storytelling via Predicting Anchor Word Embeddings in the Stories
- Complete the Look: Scene-based Complementary Product Recommendation
- Expressing Visual Relationships via Language
- Robust Neural Malware Detection Models for Emulation Sequence Learning
- Image Captioning with Context-Aware Auxiliary Guidance
- Action-Driven Object Detection with Top-Down Visual Attentions
- Teaching Machines to Converse
- Optimal Completion Distillation for Sequence Learning
- Human-like Controllable Image Captioning with Verb-specific Semantic Roles
- Cutting-off Redundant Repeating Generations for Neural Abstractive Summarization
- Recursive Visual Attention in Visual Dialog
- Optimising for Interpretability: Convolutional Dynamic Alignment Networks
- Judge the Judges: A Large-Scale Evaluation Study of Neural Language Models for Online Review Generation
- Deep Fusion of Local and Non-Local Features for Precision Landslide Recognition
- Automatic Music Highlight Extraction using Convolutional Recurrent Attention Networks
- Applications of Deep Learning in Fundus Images: A Review
- Multimodal Differential Network for Visual Question Generation
- Applications of Machine Learning in Document Digitisation
- Image Captioning using Deep Stacked LSTMs, Contextual Word Embeddings and Data Augmentation
- Revisiting Cross Modal Retrieval
- Spatio-temporal Attention Model for Tactile Texture Recognition
- Attention Mechanisms for Object Recognition with Event-Based Cameras
- Dense Relational Image Captioning via Multi-task Triple-Stream Networks
- Focusing on What is Relevant: Time-Series Learning and Understanding using Attention
- 3M: Multi-style image caption generation using Multi-modality features under Multi-UPDOWN model
- Teaching Machines to Code: Neural Markup Generation with Visual Attention
- Detection and Description of Change in Visual Streams
- memeBot: Towards Automatic Image Meme Generation
- Attention-based Memory Selection Recurrent Network for Language Modeling
- ASAC: Active Sensing using Actor-Critic models
- Generating Diverse and Informative Natural Language Fashion Feedback
- Stereo Vision Based Single-Shot 6D Object Pose Estimation for Bin-Picking by a Robot Manipulator
- Integrating Image Captioning with Rule-based Entity Masking
- Active Perception and Representation for Robotic Manipulation
- FMA-ETA: Estimating Travel Time Entirely Based on FFN With Attention
- Cost-effective Interactive Attention Learning with Neural Attention Processes
- XRayGAN: Consistency-preserving Generation of X-ray Images from Radiology Reports
- Trends and Advancements in Deep Neural Network Communication
- User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
- A Hybrid Vision Transformer Approach for Mathematical Expression Recognition
- Unmixing Convolutional Features for Crisp Edge Detection
- Inductive Guided Filter: Real-time Deep Image Matting with Weakly Annotated Masks on Mobile Devices
- A human-inspired recognition system for premodern Japanese historical documents
- PhilaeX: Explaining the Failure and Success of AI Models in Malware Detection
- Identifying Most Walkable Direction for Navigation in an Outdoor Environment
- One-Shot Learning on Attributed Sequences
- UniVSE: Robust Visual Semantic Embeddings via Structured Semantic Representations
- Keep it Consistent: Topic-Aware Storytelling from an Image Stream via Iterative Multi-agent Communication
- Flexible Compositional Learning of Structured Visual Concepts
- GCNBoost: Artwork Classification by Label Propagation through a Knowledge Graph
- Exploring modality-agnostic representations for music classification
- Dual-attention Focused Module for Weakly Supervised Object Localization
- Hierarchy Parsing for Image Captioning
- Select and Attend: Towards Controllable Content Selection in Text Generation
- Learning from Videos with Deep Convolutional LSTM Networks
- SumQE: a BERT-based Summary Quality Estimation Model
- Snap and Find: Deep Discrete Cross-domain Garment Image Retrieval
- Spatiotemporal Pyramid Network for Video Action Recognition
- Improving Noise Robustness In Speaker Identification Using A Two-Stage Attention Model
- Fingerspelling recognition in the wild with iterative visual attention
- Passive Attention in Artificial Neural Networks Predicts Human Visual Selectivity
- A State-of-the-art Survey of Artificial Neural Networks for Whole-slide Image Analysis:from Popular Convolutional Neural Networks to Potential Visual Transformers
- Tagger: Deep Unsupervised Perceptual Grouping
- DeepRA: Predicting Joint Damage From Radiographs Using CNN with Attention
- Protect, Show, Attend and Tell: Empowering Image Captioning Models with Ownership Protection
- Transfer Learning in Electronic Health Records through Clinical Concept Embedding
- Visual Fashion-Product Search at SK Planet
- Image Captioning and Classification of Dangerous Situations
- Dual Graph Convolutional Networks with Transformer and Curriculum Learning for Image Captioning
- Read, Tag, and Parse All at Once, or Fully-neural Dependency Parsing
- Challenges for cognitive decoding using deep learning methods
- GTNet:Guided Transformer Network for Detecting Human-Object Interactions
- Exact Hard Monotonic Attention for Character-Level Transduction
- Label-Attention Transformer with Geometrically Coherent Objects for Image Captioning
- Meta Dropout: Learning to Perturb Features for Generalization
- DelugeNets: Deep Networks with Efficient and Flexible Cross-layer Information Inflows
- An Empirical Study of Language CNN for Image Captioning
- Early Improving Recurrent Elastic Highway Network
- MHAttnSurv: Multi-Head Attention for Survival Prediction Using Whole-Slide Pathology Images
- Perceive, Attend, and Drive: Learning Spatial Attention for Safe Self-Driving
- Gaussian Smoothen Semantic Features (GSSF) -- Exploring the Linguistic Aspects of Visual Captioning in Indian Languages (Bengali) Using MSCOCO Framework
- Domain-Level Explainability -- A Challenge for Creating Trust in Superhuman AI Strategies
- Learning to Disambiguate by Asking Discriminative Questions
- A Structured Model For Action Detection
- Attention Aware Cost Volume Pyramid Based Multi-view Stereo Network for 3D Reconstruction
- Towards Accurate Text-based Image Captioning with Content Diversity Exploration
- Bringing back simplicity and lightliness into neural image captioning
- Improving unsupervised anomaly localization by applying multi-scale memories to autoencoders
- Coarse to Fine: Multi-label Image Classification with Global/Local Attention
- C4Synth: Cross-Caption Cycle-Consistent Text-to-Image Synthesis
- Multi-Resolution Weak Supervision for Sequential Data
- ConvMath: A Convolutional Sequence Network for Mathematical Expression Recognition
- Captioning Images with Novel Objects via Online Vocabulary Expansion
- Product Function Need Recognition via Semi-supervised Attention Network
- Dynamic Filtering with Large Sampling Field for ConvNets
- Salient Object Ranking with Position-Preserved Attention
- Spatial-Aware Non-Local Attention for Fashion Landmark Detection
- Neural Naturalist: Generating Fine-Grained Image Comparisons
- AFS: An Attention-based mechanism for Supervised Feature Selection
- Efficient Realistic Data Generation Framework leveraging Deep Learning-based Human Digitization
- AON: Towards Arbitrarily-Oriented Text Recognition
- Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck
- Online Multi-Object Tracking with Dual Matching Attention Networks
- Multilevel Language and Vision Integration for Text-to-Clip Retrieval
- DAWN: Dual Augmented Memory Network for Unsupervised Video Object Tracking
- A Deep Decoder Structure Based on WordEmbedding Regression for An Encoder-Decoder Based Model for Image Captioning
- Interventional Video Grounding with Dual Contrastive Learning
- Spatial Memory for Context Reasoning in Object Detection
- Widget Captioning: Generating Natural Language Description for Mobile User Interface Elements
- Image Captioning with Sparse Recurrent Neural Network
- AutoScaler: Scale-Attention Networks for Visual Correspondence
- Exploring and Distilling Cross-Modal Information for Image Captioning
- B-SCST: Bayesian Self-Critical Sequence Training for Image Captioning
- StarMap for Category-Agnostic Keypoint and Viewpoint Estimation
- Learning Image Labels On-the-fly for Training Robust Classification Models
- Attention-based Neural Text Segmentation
- Learning Graph Pooling and Hybrid Convolutional Operations for Text Representations
- TextNet: Irregular Text Reading from Images with an End-to-End Trainable Network
- Neural Aesthetic Image Reviewer
- Self Attention Grid for Person Re-Identification
- Understanding Contexts Inside Robot and Human Manipulation Tasks through a Vision-Language Model and Ontology System in a Video Stream
- Multi-Task Time Series Forecasting With Shared Attention
- End-to-End Speaker Height and age estimation using Attention Mechanism with LSTM-RNN
- MANet: Multimodal Attention Network based Point- View fusion for 3D Shape Recognition
- Learning with Sets in Multiple Instance Regression Applied to Remote Sensing
- Dynamically Extracting Outcome-Specific Problem Lists from Clinical Notes with Guided Multi-Headed Attention
- A Convolutional Baseline for Person Re-Identification Using Vision and Language Descriptions
- Context-Aware Group Captioning via Self-Attention and Contrastive Features
- Robust Raw Waveform Speech Recognition Using Relevance Weighted Representations
- Multi-task Learning with Attention for End-to-end Autonomous Driving
- Long Short-Term Memory Spatial Transformer Network
- Discrete-continuous Action Space Policy Gradient-based Attention for Image-Text Matching
- TandemNet: Distilling Knowledge from Medical Images Using Diagnostic Reports as Optional Semantic References
- AMENet: Attentive Maps Encoder Network for Trajectory Prediction
- LEAFAGE: Example-based and Feature importance-based Explanationsfor Black-box ML models
- ViP-CNN: Visual Phrase Guided Convolutional Neural Network
- Lossless Attention in Convolutional Networks for Facial Expression Recognition in the Wild
- Attend More Times for Image Captioning
- Learning to Structure Long-term Dependence for Sequential Recommendation
- Sequence-Level Mixed Sample Data Augmentation
- Egoshots, an ego-vision life-logging dataset and semantic fidelity metric to evaluate diversity in image captioning models
- Improving Sequential Determinantal Point Processes for Supervised Video Summarization
- CADP: A Novel Dataset for CCTV Traffic Camera based Accident Analysis
- Spatio-Temporal LSTM with Trust Gates for 3D Human Action Recognition
- Multilevel Context Representation for Improving Object Recognition
- Spatial-Temporal Alignment Network for Action Recognition and Detection
- Multiple Range-Restricted Bidirectional Gated Recurrent Units with Attention for Relation Classification
- Learning to Represent Image and Text with Denotation Graph
- Jewelry Recognition via Encoder-Decoder Models
- Embeddings and Representation Learning for Structured Data
- SSCR: Iterative Language-Based Image Editing via Self-Supervised Counterfactual Reasoning
- Federated Multi-task Hierarchical Attention Model for Sensor Analytics
- Reverse-engineering Bar Charts Using Neural Networks
- Pointing Novel Objects in Image Captioning
- Influence-aware Memory Architectures for Deep Reinforcement Learning
- Putting visual object recognition in context
- Video Sentiment Analysis with Bimodal Information-augmented Multi-Head Attention
- Handling Missing Observations with an RNN-based Prediction-Update Cycle
- Towards Unique and Informative Captioning of Images
- Deep EHR Spotlight: a Framework and Mechanism to Highlight Events in Electronic Health Records for Explainable Predictions
- Show, Control and Tell: A Framework for Generating Controllable and Grounded Captions
- Refined Gate: A Simple and Effective Gating Mechanism for Recurrent Units
- Improved Res2Net model for Person re-identification
- Macroscopic Control of Text Generation for Image Captioning
- Writing by Memorizing: Hierarchical Retrieval-based Medical Report Generation
- Exploring Semantic Relationships for Unpaired Image Captioning
- An Optimization and Generalization Analysis for Max-Pooling Networks
- An Empirical Investigation of Global and Local Normalization for Recurrent Neural Sequence Models Using a Continuous Relaxation to Beam Search
- MSVD-Turkish: A Comprehensive Multimodal Dataset for Integrated Vision and Language Research in Turkish
- Adaptive Offline Quintuplet Loss for Image-Text Matching
- XAI-P-T: A Brief Review of Explainable Artificial Intelligence from Practice to Theory
- Alignment Attention by Matching Key and Query Distributions
- Synergistic saliency and depth prediction for RGB-D saliency detection
- SCNet: A Generalized Attention-based Model for Crack Fault Segmentation
- Compression and Localization in Reinforcement Learning for ATARI Games
- HABNet: Machine Learning, Remote Sensing Based Detection and Prediction of Harmful Algal Blooms
- AiR: Attention with Reasoning Capability
- Exploiting Cross-Modal Prediction and Relation Consistency for Semi-Supervised Image Captioning
- Learning Contextual Causality from Time-consecutive Images
- Neural Machine Translation: A Review and Survey
- Progress in deep Markov State Modeling: Coarse graining and experimental data restraints
- Enhanced 3D Human Pose Estimation from Videos by using Attention-Based Neural Network with Dilated Convolutions
- Personalized Multimodal Feedback Generation in Education
- Self-Annotated Training for Controllable Image Captioning
- Adaptive Correlated Monte Carlo for Contextual Categorical Sequence Generation
- Attribute-Aware Attention Model for Fine-grained Representation Learning
- Fine-grained Classification of Rowing teams
- Empirical Analysis of Image Caption Generation using Deep Learning
- Why Attentions May Not Be Interpretable?
- Mitigating Gender Bias in Captioning Systems
- Foveation for Segmentation of Ultra-High Resolution Images
- Supervised Deep Sparse Coding Networks
- Attention-Based End-to-End Speech Recognition on Voice Search
- Neural Network architectures to classify emotions in Indian Classical Music
- Attention-based Recurrent Neural Network for Urban Vehicle Trajectory Prediction
- SAdam: A Variant of Adam for Strongly Convex Functions
- A self-attention based deep learning method for lesion attribute detection from CT reports
- Adversarial Sub-sequence for Text Generation
- Hard Non-Monotonic Attention for Character-Level Transduction
- Object Detection from Scratch with Deep Supervision
- VideoLightFormer: Lightweight Action Recognition using Transformers
- Beyond VQA: Generating Multi-word Answer and Rationale to Visual Questions
- Grounded Video Description
- Not All Attention Is Needed: Gated Attention Network for Sequence Data
- Dynamic Graph Modules for Modeling Object-Object Interactions in Activity Recognition
- Fine-grained Video Categorization with Redundancy Reduction Attention
- Few-Shot Object Recognition from Machine-Labeled Web Images
- Toward Tag-free Aspect Based Sentiment Analysis: A Multiple Attention Network Approach
- Tackling Sequence to Sequence Mapping Problems with Neural Networks
- Natural Vocabulary Emerges from Free-Form Annotations
- Chained Predictions Using Convolutional Neural Networks
- A simple and effective postprocessing method for image classification
- Gradient Importance Learning for Incomplete Observations
- RATCHET: Medical Transformer for Chest X-ray Diagnosis and Reporting
- Graph Attention Networks with Positional Embeddings
- Learning to Caption Images through a Lifetime by Asking Questions
- Hierarchical Photo-Scene Encoder for Album Storytelling
- SelfExplain: A Self-Explaining Architecture for Neural Text Classifiers
- Randomness in Deconvolutional Networks for Visual Representation
- Structural and Functional Decomposition for Personality Image Captioning in a Communication Game
- KoSpeech: Open-Source Toolkit for End-to-End Korean Speech Recognition
- Adversarial reconstruction for Multi-modal Machine Translation
- Data Fusion for Deep Learning on Transport Mode Detection: A Case Study
- SMYRF: Efficient Attention using Asymmetric Clustering
- Connecting What to Say With Where to Look by Modeling Human Attention Traces
- MAGNet: Multi-Region Attention-Assisted Grounding of Natural Language Queries at Phrase Level
- Attention-based Transfer Learning for Brain-computer Interface
- Click Here: Human-Localized Keypoints as Guidance for Viewpoint Estimation
- Improving Image Captioning by Leveraging Knowledge Graphs
- Predicting the time-evolution of multi-physics systems with sequence-to-sequence models
- Deep Features Analysis with Attention Networks
- Optimizing Deep Neural Networks with Multiple Search Neuroevolution
- Graph Representation Learning via Hard and Channel-Wise Attention Networks
- Integrating Scene Text and Visual Appearance for Fine-Grained Image Classification
- Image Based Review Text Generation with Emotional Guidance
- Semi-Autoregressive Transformer for Image Captioning
- EXplainable Neural-Symbolic Learning (X-NeSyL) methodology to fuse deep learning representations with expert knowledge graphs: the MonuMAI cultural heritage use case
- Image Captioning with Unseen Objects
- Transforming Multi-Concept Attention into Video Summarization
- Show, Attend and Translate: Unpaired Multi-Domain Image-to-Image Translation with Visual Attention
- Compare and Reweight: Distinctive Image Captioning Using Similar Images Sets
- EDSL: An Encoder-Decoder Architecture with Symbol-Level Features for Printed Mathematical Expression Recognition
- Face-Cap: Image Captioning using Facial Expression Analysis
- Separate and Attend in Personal Email Search
- An Overview on Data Representation Learning: From Traditional Feature Learning to Recent Deep Learning
- Decoupled Spatial Temporal Graphs for Generic Visual Grounding
- An Attention Module for Convolutional Neural Networks
- Evaluating Text-to-Image Matching using Binary Image Selection (BISON)
- Automated Generation of Accurate \& Fluent Medical X-ray Reports
- AICAttack: Adversarial Image Captioning Attack with Attention-Based Optimization
- From Recognition to Prediction: Analysis of Human Action and Trajectory Prediction in Video
- Visual Curiosity: Learning to Ask Questions to Learn Visual Recognition
- CI-Net: Contextual Information for Joint Semantic Segmentation and Depth Estimation
- Autonomous Vehicles Drive into Shared Spaces: eHMI Design Concept Focusing on Vulnerable Road Users
- Where to Look: A Unified Attention Model for Visual Recognition with Reinforcement Learning
- Paying Attention to Descriptions Generated by Image Captioning Models
- AFN: Attentional Feedback Network based 3D Terrain Super-Resolution
- M2FN: Multi-step Modality Fusion for Advertisement Image Assessment
- Kite: Automatic speech recognition for unmanned aerial vehicles
- Graph-Based Continual Learning
- Coarse-to-fine: A RNN-based hierarchical attention model for vehicle re-identification
- Finding a Needle in a Haystack: Tiny Flying Object Detection in 4K Videos using a Joint Detection-and-Tracking Approach
- Mega-Reward: Achieving Human-Level Play without Extrinsic Rewards
- Geometry-Entangled Visual Semantic Transformer for Image Captioning
- Intention Oriented Image Captions with Guiding Objects
- Temporal Attention-Gated Model for Robust Sequence Classification
- Deep learning approaches for neural decoding: from CNNs to LSTMs and spikes to fMRI
- Grounded and Controllable Image Completion by Incorporating Lexical Semantics
- A Feasible Framework for Arbitrary-Shaped Scene Text Recognition
- SAFIN: Arbitrary Style Transfer With Self-Attentive Factorized Instance Normalization
- Valid Explanations for Learning to Rank Models
- Iterative Shrinking for Referring Expression Grounding Using Deep Reinforcement Learning
- Modeling Long-Term and Short-Term Interests with Parallel Attentions for Session-based Recommendation
- Unsupervised Typography Transfer
- A Neural Attention Model for Adaptive Learning of Social Friends' Preferences
- Event Recognition with Automatic Album Detection based on Sequential Processing, Neural Attention and Image Captioning
- Attention-Guided Network for Iris Presentation Attack Detection
- Bayesian Attention Modules
- BiST: Bi-directional Spatio-Temporal Reasoning for Video-Grounded Dialogues
- Interpreting Deep Learning Model Using Rule-based Method
- Towards Understanding Sample Variance in Visually Grounded Language Generation: Evaluations and Observations
- FoveaTer: Foveated Transformer for Image Classification
- Exploring Explicit and Implicit Visual Relationships for Image Captioning
- Denoising Large-Scale Image Captioning from Alt-text Data using Content Selection Models
- SMURF: SeMantic and linguistic UndeRstanding Fusion for Caption Evaluation via Typicality Analysis
- Soft Attention: Does it Actually Help to Learn Social Interactions in Pedestrian Trajectory Prediction?
- SeqDialN: Sequential Visual Dialog Networks in Joint Visual-Linguistic Representation Space
- Explanation of Reinforcement Learning Model in Dynamic Multi-Agent System
- RTFN: Robust Temporal Feature Network
- Diverse and Styled Image Captioning Using SVD-Based Mixture of Recurrent Experts
- Multiple Visual-Semantic Embedding for Video Retrieval from Query Sentence
- Towards Relevance and Sequence Modeling in Language Recognition
- TRACER: A Framework for Facilitating Accurate and Interpretable Analytics for High Stakes Applications
- Learning Compact Reward for Image Captioning
- vieCap4H-VLSP 2021: Vietnamese Image Captioning for Healthcare Domain using Swin Transformer and Attention-based LSTM
- A Neural Architecture for Detecting Confusion in Eye-tracking Data
- PBRnet: Pyramidal Bounding Box Refinement to Improve Object Localization Accuracy
- On the Learning Dynamics of Attention Networks
- Understanding attention-based encoder-decoder networks: a case study with chess scoresheet recognition
- Exploiting Temporal Coherence for Multi-modal Video Categorization
- When Better Eyes Lead to Blindness: A Diagnostic Study of the Information Bottleneck in CNN-LSTM Image Captioning Models
- Automatic Identification and Description of Jewelry Through Computer Vision and Neural Networks for Translators and Interpreters
- Adaptive Beam Search to Enhance On-device Abstractive Summarization
- Self-attention Multi-view Representation Learning with Diversity-promoting Complementarity
- Questions to Guide the Future of Artificial Intelligence Research
- Modeling Coreference Relations in Visual Dialog
- Making the Best Use of Review Summary for Sentiment Analysis
- Removing Word-Level Spurious Alignment between Images and Pseudo-Captions in Unsupervised Image Captioning
- Transfer Reward Learning for Policy Gradient-Based Text Generation
- Deconfounded Video Moment Retrieval with Causal Intervention
- Look and Modify: Modification Networks for Image Captioning
- Interpreting Undesirable Pixels for Image Classification on Black-Box Models
- Improving Captioning for Low-Resource Languages by Cycle Consistency
- Cavs: A Vertex-centric Programming Interface for Dynamic Neural Networks
- Memory and attention in deep learning
- Controlled Caption Generation for Images Through Adversarial Attacks
- Variational Topic Inference for Chest X-Ray Report Generation
- Will Multi-modal Data Improves Few-shot Learning?
- RAIN: Reinforced Hybrid Attention Inference Network for Motion Forecasting
- Question-controlled Text-aware Image Captioning
- Cooperative image captioning
- Screen2Words: Automatic Mobile UI Summarization with Multimodal Learning
- Machine Learning and System Identification for Estimation in Physical Systems
- Goal-driven text descriptions for images
- Understanding Character Recognition using Visual Explanations Derived from the Human Visual System and Deep Networks
- Multimodal Incremental Transformer with Visual Grounding for Visual Dialogue Generation
- Semi-Autoregressive Image Captioning
- BioIE: Biomedical Information Extraction with Multi-head Attention Enhanced Graph Convolutional Network
- Lift-the-flap: what, where and when for context reasoning
- Augmenting Images for ASR and TTS through Single-loop and Dual-loop Multimodal Chain Framework
- MLAS: Metric Learning on Attributed Sequences
- Integrating Human Gaze into Attention for Egocentric Activity Recognition
- Neural Rejuvenation: Improving Deep Network Training by Enhancing Computational Resource Utilization
- G-RCN: Optimizing the Gap between Classification and Localization Tasks for Object Detection
- A Multi-task Neural Approach for Emotion Attribution, Classification and Summarization
- Neuro-Symbolic Representations for Video Captioning: A Case for Leveraging Inductive Biases for Vision and Language
- Scene Parsing via Dense Recurrent Neural Networks with Attentional Selection
- BERT-hLSTMs: BERT and Hierarchical LSTMs for Visual Storytelling
- Robust Image Captioning
- Generating Easy-to-Understand Referring Expressions for Target Identifications
- Dependency Decomposition and a Reject Option for Explainable Models
- SPICE: Semantic Propositional Image Caption Evaluation
- The neural and cognitive architecture for learning from a small sample
- Give me a hint! Navigating Image Databases using Human-in-the-loop Feedback
- Image Captioning based on Deep Reinforcement Learning
- Experiential Robot Learning with Accelerated Neuroevolution
- MLMA-Net: multi-level multi-attentional learning for multi-label object detection in textile defect images
- Grounding Visual Explanations
- GaitSet: Cross-view Gait Recognition through Utilizing Gait as a Deep Set
- Multichannel LSTM-CNN for Telugu Technical Domain Identification
- A Universal Model for Cross Modality Mapping by Relational Reasoning
- Which to Match? Selecting Consistent GT-Proposal Assignment for Pedestrian Detection
- A New Benchmark and Progress Toward Improved Weakly Supervised Learning
- Combining Pyramid Pooling and Attention Mechanism for Pelvic MR Image Semantic Segmentaion
- Best Vision Technologies Submission to ActivityNet Challenge 2018-Task: Dense-Captioning Events in Videos
- Grounded Textual Entailment
- Visual Attention in Imaginative Agents
- Mind the Gap: On Bridging the Semantic Gap between Machine Learning and Information Security
- Towards Embodied Scene Description
- Attentional Bottleneck: Towards an Interpretable Deep Driving Network
- Joint learning of interpretation and distillation
- CompGuessWhat?!: A Multi-task Evaluation Framework for Grounded Language Learning
- FPAN: Fine-grained and Progressive Attention Localization Network for Data Retrieval
- Dense Adaptive Cascade Forest: A Self Adaptive Deep Ensemble for Classification Problems
- Towards Robust Pattern Recognition: A Review
- Hyperparameter Analysis for Image Captioning
- Visual Attention for Musical Instrument Recognition
- Robot Object Retrieval with Contextual Natural Language Queries
- Modality Shifting Attention Network for Multi-modal Video Question Answering
- Connectionist Recommendation in the Wild: On the utility and scrutability of neural networks for personalized course guidance
- Understanding Spatial Relations through Multiple Modalities
- Human Action Adverb Recognition: ADHA Dataset and A Three-Stream Hybrid Model
- Improving Skeleton-based Action Recognitionwith Robust Spatial and Temporal Features
- Learning Transition Models with Time-delayed Causal Relations
- Selective Particle Attention: Visual Feature-Based Attention in Deep Reinforcement Learning
- Visualizing Color-wise Saliency of Black-Box Image Classification Models
- Paying Attention to Function Words
- A Self Validation Network for Object-Level Human Attention Estimation
- Graph Analysis and Graph Pooling in the Spatial Domain
- Tell-the-difference: Fine-grained Visual Descriptor via a Discriminating Referee
- AtLoc: Attention Guided Camera Localization
- On Architectures for Including Visual Information in Neural Language Models for Image Description
- Sequence-to-Set Semantic Tagging: End-to-End Multi-label Prediction using Neural Attention for Complex Query Reformulation and Automated Text Categorization
- Learning to Localize Sound Sources in Visual Scenes: Analysis and Applications
- Distraction-Aware Feature Learning for Human Attribute Recognition via Coarse-to-Fine Attention Mechanism
- DMRM: A Dual-channel Multi-hop Reasoning Model for Visual Dialog
- Deep Exemplar Networks for VQA and VQG
- Visual Agreement Regularized Training for Multi-Modal Machine Translation
- Recurrent Multimodal Interaction for Referring Image Segmentation
- What Changed Your Mind: The Roles of Dynamic Topics and Discourse in Argumentation Process
- When Radiology Report Generation Meets Knowledge Graph
- Expressing Objects just like Words: Recurrent Visual Embedding for Image-Text Matching
- The Amazing Mysteries of the Gutter: Drawing Inferences Between Panels in Comic Book Narratives
- Joint Spatial and Layer Attention for Convolutional Networks
- Progressively Diffused Networks for Semantic Image Segmentation
- Leveraging Visual Question Answering for Image-Caption Ranking
- Character-Level Neural Translation for Multilingual Media Monitoring in the SUMMA Project
- You Only Look & Listen Once: Towards Fast and Accurate Visual Grounding
- Boosted Attention: Leveraging Human Attention for Image Captioning
- Knowing When to Stop: Evaluation and Verification of Conformity to Output-size Specifications
- Incorporating Sememes into Chinese Definition Modeling
- Less Memory, Faster Speed: Refining Self-Attention Module for Image Reconstruction
- Image Captioning with Integrated Bottom-Up and Multi-level Residual Top-Down Attention for Game Scene Understanding
- Distilling Translations with Visual Awareness
- Follow the Attention: Combining Partial Pose and Object Motion for Fine-Grained Action Detection
- Deep Fisher Discriminant Learning for Mobile Hand Gesture Recognition
- Sensor Transformation Attention Networks
- Learning to Look Around: Intelligently Exploring Unseen Environments for Unknown Tasks
- Parallel Attention: A Unified Framework for Visual Object Discovery through Dialogs and Queries
- Learning Conjoint Attentions for Graph Neural Nets
- Integrated Generalized Zero-Shot Learning for Fine-Grained Classification
- Data in context: How digital transformation can support human reasoning in cyber-physical production systems
- Rethinking the Form of Latent States in Image Captioning
- Sidekick Policy Learning for Active Visual Exploration
- MGD-GAN: Text-to-Pedestrian generation through Multi-Grained Discrimination
- Attention-Driven Body Pose Encoding for Human Activity Recognition
- Image Captioning using Multiple Transformers for Self-Attention Mechanism
- The Role of the Input in Natural Language Video Description
- Image-specific Convolutional Kernel Modulation for Single Image Super-resolution
- Visual Question Answering Using Semantic Information from Image Descriptions
- Video-Based Convolutional Attention for Person Re-Identification
- Recurrent Soft Attention Model for Common Object Recognition
- Hidden State Guidance: Improving Image Captioning using An Image Conditioned Autoencoder
- Exploring a Unified Attention-Based Pooling Framework for Speaker Verification
- Deep Learning based Urban Vehicle Trajectory Analytics
- Hierarchical Neural Network for Extracting Knowledgeable Snippets and Documents
- Dex: Incremental Learning for Complex Environments in Deep Reinforcement Learning
- Dynamic Attention Networks for Task Oriented Grounding
- Narration Generation for Cartoon Videos
- Exploration on Grounded Word Embedding: Matching Words and Images with Image-Enhanced Skip-Gram Model
- Enabling Robots to Draw and Tell: Towards Visually Grounded Multimodal Description Generation
- Assisting human experts in the interpretation of their visual process: A case study on assessing copper surface adhesive potency
- Neural Sequence Model Training via -divergence Minimization
- Can adversarial training learn image captioning ?
- Modulated Self-attention Convolutional Network for VQA
- MULTIMODAL ANALYSIS: Informed content estimation and audio source separation
- Spatio-Temporal Event Segmentation and Localization for Wildlife Extended Videos
- Two-Headed Monster And Crossed Co-Attention Networks
- An Investigation of Language Model Interpretability via Sentence Editing
- Unifying Relational Sentence Generation and Retrieval for Medical Image Report Composition
- Towards Making Deep Transfer Learning Never Hurt
- Yaw-Guided Imitation Learning for Autonomous Driving in Urban Environments
- Probability Trajectory: One New Movement Description for Trajectory Prediction
- Understanding and Improving Recurrent Networks for Human Activity Recognition by Continuous Attention
- T-EMDE: Sketching-based global similarity for cross-modal retrieval
- Knowledge as Invariance -- History and Perspectives of Knowledge-augmented Machine Learning
- Middle-Out Decoding
- Quantum Statistics-Inspired Neural Attention
- Solar Power Plant Detection on Multi-Spectral Satellite Imagery using Weakly-Supervised CNN with Feedback Features and m-PCNN Fusion
- Spatio-Temporal Road Scene Reconstruction using Superpixel Markov Random Field
- Cost-Aware Fine-Grained Recognition for IoTs Based on Sequential Fixations
- A Novel Technique for Evidence based Conditional Inference in Deep Neural Networks via Latent Feature Perturbation
- Water Supply Prediction Based on Initialized Attention Residual Network
- Understanding Attention: In Minds and Machines
- A General Divergence Modeling Strategy for Salient Object Detection
- Sequence-to-Sequence Learning with Latent Neural Grammars
- Generating Descriptions for Sequential Images with Local-Object Attention and Global Semantic Context Modelling
- A Multimodal Target-Source Classifier with Attention Branches to Understand Ambiguous Instructions for Fetching Daily Objects
- Learning to Reweight with Deep Interactions
- Blind signal decomposition of various word embeddings based on join and individual variance explained
- Using Text to Teach Image Retrieval
- Recurrent Models for Situation Recognition
- Image2song: Song Retrieval via Bridging Image Content and Lyric Words
- Weakly Supervised Learning of Heterogeneous Concepts in Videos
- Eye of the Mind: Image Processing for Social Coding
- Master Thesis: Neural Sign Language Translation by Learning Tokenization
- Summarizing Videos with Attention
- Improving Calibration in Deep Metric Learning With Cross-Example Softmax
- Progress Estimation and Phase Detection for Sequential Processes
- DORB: Dynamically Optimizing Multiple Rewards with Bandits
- O2NA: An Object-Oriented Non-Autoregressive Approach for Controllable Video Captioning
- DoLFIn: Distributions over Latent Features for Interpretability
- Text Classification with Lexicon from PreAttention Mechanism
- Image Captioning with Visual Object Representations Grounded in the Textual Modality
- Attending Category Disentangled Global Context for Image Classification
- Learning Fixation Point Strategy for Object Detection and Classification
- ST-ABN: Visual Explanation Taking into Account Spatio-temporal Information for Video Recognition
- Learning to Rank for Active Learning: A Listwise Approach
- Leveraging Recursive Gumbel-Max Trick for Approximate Inference in Combinatorial Spaces
- Image to Language Understanding: Captioning approach
- Self-Supervision and Spatial-Sequential Attention Based Loss for Multi-Person Pose Estimation
- PR Product: A Substitute for Inner Product in Neural Networks
- Topic Scene Graph Generation by Attention Distillation from Caption
- Reason induced visual attention for explainable autonomous driving
- Recurrent Attention Models with Object-centric Capsule Representation for Multi-object Recognition
- Calibrating Concepts and Operations: Towards Symbolic Reasoning on Real Images
- Multi-granular Legal Topic Classification on Greek Legislation
- CLARA: Clinical Report Auto-completion
- Weakly Supervised Contrastive Learning for Chest X-Ray Report Generation
- Audio Caption in a Car Setting with a Sentence-Level Loss
- Improving Weakly-supervised Object Localization via Causal Intervention
- Using stochastic computation graphs formalism for optimization of sequence-to-sequence model
- Recurrent 3D Attentional Networks for End-to-End Active Object Recognition
- Learning Robust Video Synchronization without Annotations
- We went to look for meaning and all we got were these lousy representations: aspects of meaning representation for computational semantics
- The Number of Steps Needed for Nonconvex Optimization of a Deep Learning Optimizer is a Rational Function of Batch Size
- Progressive Transformer-Based Generation of Radiology Reports
- Neural Twins Talk & Alternative Calculations
- Enhancing Social Relation Inference with Concise Interaction Graph and Discriminative Scene Representation
- "Show me the cup": Reference with Continuous Representations
- Experimenting with Self-Supervision using Rotation Prediction for Image Captioning
- Multi-Scale Label Relation Learning for Multi-Label Classification Using 1-Dimensional Convolutional Neural Networks
- Visual Reasoning of Feature Attribution with Deep Recurrent Neural Networks
- Towards Efficient Tensor Decomposition-Based DNN Model Compression with Optimization Framework
- Surgical Instruction Generation with Transformers
- REAPS: Towards Better Recognition of Fine-grained Images by Region Attending and Part Sequencing
- Audio-Oriented Multimodal Machine Comprehension: Task, Dataset and Model
- An RNN-based IMM Filter Surrogate
- Recognizing Part Attributes with Insufficient Data
- Deep Learning for Wireless Coded Caching with Unknown and Time-Variant Content Popularity
- Case Relation Transformer: A Crossmodal Language Generation Model for Fetching Instructions
- Contrastive Semantic Similarity Learning for Image Captioning Evaluation with Intrinsic Auto-encoder
- Decision Machines: Congruent Decision Trees
- MICIK: MIning Cross-Layer Inherent Similarity Knowledge for Deep Model Compression
- Invertible Attention
- Actions Generation from Captions
- Network Analysis for Explanation
- Beyond Language: Learning Commonsense from Images for Reasoning
- Phrase Grounding by Soft-Label Chain Conditional Random Field
- Saying the Unseen: Video Descriptions via Dialog Agents
- A Weighted Multi-Criteria Decision Making Approach for Image Captioning
- MED-TEX: Transferring and Explaining Knowledge with Less Data from Pretrained Medical Imaging Models
- Towards Unbiased Visual Emotion Recognition via Causal Intervention
- Learning Parallax Attention for Stereo Image Super-Resolution
- Do Encoder Representations of Generative Dialogue Models Encode Sufficient Information about the Task ?
- MOC-GAN: Mixing Objects and Captions to Generate Realistic Images
- BSDAR: Beam Search Decoding with Attention Reward in Neural Keyphrase Generation
- End-to-End Learning Using Cycle Consistency for Image-to-Caption Transformations
- Improve Diverse Text Generation by Self Labeling Conditional Variational Auto Encoder
- Scene-based Factored Attention for Image Captioning
- The Long-Short Story of Movie Description
- Decoupled Box Proposal and Featurization with Ultrafine-Grained Semantic Labels Improve Image Captioning and Visual Question Answering
- Stack-VS: Stacked Visual-Semantic Attention for Image Caption Generation
- Speculative Beam Search for Simultaneous Translation
- Automated Knee X-ray Report Generation
- Constructing Gradient Controllable Recurrent Neural Networks Using Hamiltonian Dynamics
- Unsupervised Keyword Extraction for Full-sentence VQA
- Synthesizing Photorealistic Images with Deep Generative Learning
- Multimodal Attention Networks for Low-Level Vision-and-Language Navigation
- Kernel Identification Through Transformers
- Human-Centered Emotion Recognition in Animated GIFs
- Machine Vision for Improved Human-Robot Cooperation in Adverse Underwater Conditions
- Dyadic Human Motion Prediction
- Conditionally Learn to Pay Attention for Sequential Visual Task
- Generative Memorize-Then-Recall framework for low bit-rate Surveillance Video Compression
- Visual Summary of Value-level Feature Attribution in Prediction Classes with Recurrent Neural Networks
- GIT-CXR: End-to-End Transformer for Chest X-Ray Report Generation
- Explain and Improve: LRP-Inference Fine-Tuning for Image Captioning Models
- Learning to Reconstruct and Segment 3D Objects
- Predicting and Explaining Hearing Aid Usage Using Encoder-Decoder with Attention Mechanism and SHAP
- KDExplainer: A Task-oriented Attention Model for Explaining Knowledge Distillation
- AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale
- OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement
- Recurrent Existence Determination Through Policy Optimization
- Variational latent discrete representation for time series modelling
- Deep Unified Multimodal Embeddings for Understanding both Content and Users in Social Media Networks
- Pay Attention to Convolution Filters: Towards Fast and Accurate Fine-Grained Transfer Learning
- Object-ABN: Learning to Generate Sharp Attention Maps for Action Recognition
- GIM: Gaussian Isolation Machines
- Instance-aware Remote Sensing Image Captioning with Cross-hierarchy Attention
- An Interpretable and Uncertainty Aware Multi-Task Framework for Multi-Aspect Sentiment Analysis
- Video-based Person Re-Identification using Gated Convolutional Recurrent Neural Networks
- Attention-Based Self-Supervised Feature Learning for Security Data
- Automatically Generating Codes from Graphical Screenshots Based on Deep Autocoder
- Differentiable Window for Dynamic Local Attention
- Off-Policy Self-Critical Training for Transformer in Visual Paragraph Generation
- A Few-Shot Sequential Approach for Object Counting
- Adversarial Attacks for Multi-view Deep Models
- Sparse Graph to Sequence Learning for Vision Conditioned Long Textual Sequence Generation
- Implications of Human Irrationality for Reinforcement Learning
- Object-Centric Unsupervised Image Captioning
- Applying recent advances in Visual Question Answering to Record Linkage
- Pedestrian Tracking with Gated Recurrent Units and Attention Mechanisms
- Volumetric Transformer Networks
- Active Object Localization with Deep Reinforcement Learning
- Customized Image Narrative Generation via Interactive Visual Question Generation and Answering
- Visual Interest Prediction with Attentive Multi-Task Transfer Learning
- Focus Longer to See Better:Recursively Refined Attention for Fine-Grained Image Classification
- Ventral-Dorsal Neural Networks: Object Detection via Selective Attention
- Understanding Guided Image Captioning Performance across Domains
- A New Data Normalization Method to Improve Dialogue Generation by Minimizing Long Tail Effect
- Knowledge-Based Visual Question Answering in Videos
- Hybrid Attention Networks for Flow and Pressure Forecasting in Water Distribution Systems
- Surrogate Gradient Field for Latent Space Manipulation
- Channel-Based Attention for LCC Using Sentinel-2 Time Series
- Reinforcement Learning based Path Exploration for Sequential Explainable Recommendation
- Let Your Heart Speak in its Mother Tongue: Multilingual Captioning of Cardiac Signals
- Describing Textures using Natural Language
- A Self-Explainable Stylish Image Captioning Framework via Multi-References
- Recursive Multi-model Complementary Deep Fusion forRobust Salient Object Detection via Parallel Sub Networks
- Cascade Graph Neural Networks for RGB-D Salient Object Detection
- Textual Description for Mathematical Equations
- CACTUS: Detecting and Resolving Conflicts in Objective Functions
- Analysis of Convolutional Decoder for Image Caption Generation
- Dual Reinforcement-Based Specification Generation for Image De-Rendering
- Attention to Refine through Multi-Scales for Semantic Segmentation
- Neural Image Captioning
- Developing Constrained Neural Units Over Time
- PIMMS: Permutation Invariant Multi-Modal Segmentation
- Characterization and recognition of handwritten digits using Julia
- Machine Learning for Temporal Data in Finance: Challenges and Opportunities
- Exploring Font-independent Features for Scene Text Recognition
- Model-Attentive Ensemble Learning for Sequence Modeling
- Enhanced Modality Transition for Image Captioning
- NABU Multilingual Graph-based Neural RDF Verbalizer
- Distinctive-attribute Extraction for Image Captioning