Showing cs.CVShow all
2 papers · 1 filter
cs.CV2020
Fusion Models for Improved Visual Captioning
Marimuthu Kalimuthu, Aditya Mogadala, Marius Mosbach +1
Visual captioning aims to generate textual descriptions given images or videos. Traditionally, image captioning models are trained on human annotated datasets such as Flickr30k and…
cs.CV2020
Sparse Graph to Sequence Learning for Vision Conditioned Long Textual Sequence Generation
Aditya Mogadala, Marius Mosbach, Dietrich Klakow
Generating longer textual sequences when conditioned on the visual information is an interesting problem to explore. The challenge here proliferate over the standard vision conditi…