NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (88)

cs.CL2025

When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning

Nishad Singhi, Hritik Bansal, Arian Hosseini +4

cs.AI2018

Multimodal Explanations: Justifying Decisions and Pointing to the Evidence

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata +4

cs.CV2018

Visual Coreference Resolution in Visual Dialog using Neural Module Networks

Satwik Kottur, José M. F. Moura, Devi Parikh +2

cs.CV2017

Learning to Reason: End-to-End Module Networks for Visual Question Answering

Ronghang Hu, Jacob Andreas, Marcus Rohrbach +2

cs.CV2020

KRISP: Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQA

Kenneth Marino, Xinlei Chen, Devi Parikh +2

cs.CV2015

Recognizing Fine-Grained and Composite Activities using Hand-Centric Features and Script Data

Marcus Rohrbach, Anna Rohrbach, Michaela Regneri +4

cs.CV2020

Learning to Generate Grounded Visual Captions without Localization Supervision

Chih-Yao Ma, Yannis Kalantidis, Ghassan AlRegib +3

cs.CV2014

Coherent Multi-Sentence Video Description with Variable Level of Detail

Anna Senina, Marcus Rohrbach, Wei Qiu +5

cs.CV2025

DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts

Tobias Braun, Mark Rothermel, Marcus Rohrbach +1

cs.CV2026

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun +4

cs.CV2026

VETO: Towards Protecting Images From Frontier AI Editing

Jonas Grebe, Hossein Shakibania, Tobias Braun +2

The paper presents VETO, a subtle anti-edit cloak that disrupts how modern diffusion-based image editors read source images, and introduces VetoBench, a benchmark for evaluating pr…

#image editing protection#diffusion models#joint attention#anti-edit defenses
cs.CV2015

A Dataset for Movie Description

Anna Rohrbach, Marcus Rohrbach, Niket Tandon +1

cs.CV2022

Learning To Recognize Procedural Activities with Distant Supervision

Xudong Lin, Fabio Petroni, Gedas Bertasius +3

cs.CV2017

Attentive Explanations: Justifying Decisions and Pointing to the Evidence

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata +3

cs.CV2020

Decoupling Representation and Classifier for Long-Tailed Recognition

Bingyi Kang, Saining Xie, Marcus Rohrbach +4

cs.CV2016

Movie Description

Anna Rohrbach, Atousa Torabi, Marcus Rohrbach +5

cs.CV2015

Spatial Semantic Regularisation for Large Scale Object Detection

Damian Mrowca, Marcus Rohrbach, Judy Hoffman +3

cs.CV2025

Chrono: A Simple Blueprint for Representing Time in MLLMs

Hector Rodriguez, Boris Meinardus, Anil Batra +2

cs.CV2017

Attentive Explanations: Justifying Decisions and Pointing to the Evidence (Extended Abstract)

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata +4

cs.CV2017

Grounding of Textual Phrases in Images by Reconstruction

Anna Rohrbach, Marcus Rohrbach, Ronghang Hu +2

cs.LG2026

Calibrated Sampling-Free Uncertainty Estimation in Bayesian Deep Learning

Tobias Jan Wieczorek, Leon de Andrade, Thomas Möllenhoff +1

cs.CV2022

Reliable Visual Question Answering: Abstain Rather Than Answer Incorrectly

Spencer Whitehead, Suzanne Petryk, Vedaad Shakib +4

cs.CV2023

Improving Selective Visual Question Answering by Learning from Your Peers

Corentin Dancette, Spencer Whitehead, Rishabh Maheshwary +5

cs.CV2016

A Multi-scale Multiple Instance Video Description Network

Huijuan Xu, Subhashini Venugopalan, Vasili Ramanishka +2

cs.CV2016

Deep Compositional Captioning: Describing Novel Object Categories without Paired Training Data

Lisa Anne Hendricks, Subhashini Venugopalan, Marcus Rohrbach +3

cs.CR2026

Erased but Not Forgotten: How Backdoors Compromise Concept Erasure

Tobias Braun, Jonas Henry Grebe, Marcus Rohrbach +1

cs.LG2020

Uncertainty-guided Continual Learning with Bayesian Neural Networks

Sayna Ebrahimi, Mohamed Elhoseiny, Trevor Darrell +1

cs.CV2026

HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models

Reihaneh Zohrabi, Hosein Hasani, Akshita Gupta +3

cs.CV2015

Sequence to Sequence -- Video to Text

Subhashini Venugopalan, Marcus Rohrbach, Jeff Donahue +3

cs.CV2015

The Long-Short Story of Movie Description

Anna Rohrbach, Marcus Rohrbach, Bernt Schiele

cs.LG2026

Geometric Erasure by Contrastive Velocity Matching in Rectified Flows

Jonas Henry Grebe, Tobias Braun, Anna Rohrbach +1

cs.CV2019

CLEVR-Dialog: A Diagnostic Dataset for Multi-Round Reasoning in Visual Dialog

Satwik Kottur, José M. F. Moura, Devi Parikh +2

cs.CV2019

Adversarial Inference for Multi-Sentence Video Description

Jae Sung Park, Marcus Rohrbach, Trevor Darrell +1

cs.IR2026

VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking

Mark Rothermel, Marcus Kornmann, Marcus Rohrbach +1

cs.CV2026

Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs

Paul Jonas Kurz, Tobias Jan Wieczorek, Mohamed A. Abdelsalam +2

cs.CV2020

12-in-1: Multi-Task Vision and Language Representation Learning

Jiasen Lu, Vedanuj Goswami, Marcus Rohrbach +2

cs.CR2026

Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models

Tobias Braun, Jonas Henry Grebe, Hossein Shakibania +2

cs.CV2016

Ask Your Neurons: A Deep Learning Approach to Visual Question Answering

Mateusz Malinowski, Marcus Rohrbach, Mario Fritz

cs.CL2016

Learning to Compose Neural Networks for Question Answering

Jacob Andreas, Marcus Rohrbach, Trevor Darrell +1

cs.LG2019

Efficient Lifelong Learning with A-GEM

Arslan Chaudhry, Marc'Aurelio Ranzato, Marcus Rohrbach +1

cs.CV2020

Iterative Answer Prediction with Pointer-Augmented Multimodal Transformers for TextVQA

Ronghang Hu, Amanpreet Singh, Trevor Darrell +1

cs.CV2016

Natural Language Object Retrieval

Ronghang Hu, Huazhe Xu, Marcus Rohrbach +3

cs.CV2023

Simple Token-Level Confidence Improves Caption Correctness

Suzanne Petryk, Spencer Whitehead, Joseph E. Gonzalez +3

cs.LG2019

On Tiny Episodic Memories in Continual Learning

Arslan Chaudhry, Marcus Rohrbach, Mohamed Elhoseiny +4

cs.CV2016

Utilizing Large Scale Vision and Text Datasets for Image Segmentation from Referring Expressions

Ronghang Hu, Marcus Rohrbach, Subhashini Venugopalan +1

cs.CV2021

A New Split for Evaluating True Zero-Shot Action Recognition

Shreyank N Gowda, Laura Sevilla-Lara, Kiyoon Kim +2

stat.ML2019

Selfless Sequential Learning

Rahaf Aljundi, Marcus Rohrbach, Tinne Tuytelaars

cs.CV2019

Cycle-Consistency for Robust Visual Question Answering

Meet Shah, Xinlei Chen, Marcus Rohrbach +1

cs.CV2016

Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding

Akira Fukui, Dong Huk Park, Daylen Yang +3

cs.CV2017

Generating Descriptions with Grounded and Co-Referenced People

Anna Rohrbach, Marcus Rohrbach, Siyu Tang +2

cs.CV2018

Pythia v0.1: the Winning Entry to the VQA Challenge 2018

Yu Jiang, Vivek Natarajan, Xinlei Chen +3

cs.CV2019

Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution

Yunpeng Chen, Haoqi Fan, Bing Xu +5

cs.AI2026

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

Nishad Singhi, Christian Bialas, Snehal Jauhri +4

cs.CV2020

In Defense of Grid Features for Visual Question Answering

Huaizu Jiang, Ishan Misra, Marcus Rohrbach +2

cs.CV2020

TextCaps: a Dataset for Image Captioning with Reading Comprehension

Oleksii Sidorov, Ronghang Hu, Marcus Rohrbach +1

cs.CV2022

CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action Recognition

Shreyank N Gowda, Laura Sevilla-Lara, Frank Keller +1

cs.CV2017

Captioning Images with Diverse Objects

Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3

cs.CV2016

Generating Visual Explanations

Lisa Anne Hendricks, Zeynep Akata, Marcus Rohrbach +3

cs.CV2018

Memory Aware Synapses: Learning what (not) to forget

Rahaf Aljundi, Francesca Babiloni, Mohamed Elhoseiny +2

cs.CV2019

Large-Scale Visual Relationship Understanding

Ji Zhang, Yannis Kalantidis, Marcus Rohrbach +3

cs.CV2015

Translating Videos to Natural Language Using Deep Recurrent Neural Networks

Subhashini Venugopalan, Huijuan Xu, Jeff Donahue +3

cs.CV2026

ReCap: Lightweight Referential Grounding for Coherent Story Visualization

Aditya Arora, Akshita Gupta, Pau Rodriguez +1

cs.CV2017

Speaking the Same Language: Matching Machine to Human Captions by Adversarial Training

Rakshith Shetty, Marcus Rohrbach, Lisa Anne Hendricks +2

cs.CV2019

Grounded Video Description

Luowei Zhou, Yannis Kalantidis, Xinlei Chen +2

cs.CV2019

DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition

Zheng Shou, Xudong Lin, Yannis Kalantidis +4

cs.CV2015

Ask Your Neurons: A Neural-based Approach to Answering Questions about Images

Mateusz Malinowski, Marcus Rohrbach, Mario Fritz

cs.CV2017

Neural Module Networks

Jacob Andreas, Marcus Rohrbach, Trevor Darrell +1

cs.CV2024

Efficient Pre-training for Localized Instruction Generation of Videos

Anil Batra, Davide Moltisanti, Laura Sevilla-Lara +2

cs.CV2018

Graph-Based Global Reasoning Networks

Yunpeng Chen, Marcus Rohrbach, Zhicheng Yan +3

cs.CL2019

Towards VQA Models That Can Read

Amanpreet Singh, Vivek Natarajan, Meet Shah +5

cs.CL2025

Predicting Implicit Arguments in Procedural Video Instructions

Anil Batra, Laura Sevilla-Lara, Marcus Rohrbach +1

cs.CV2026

SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

Hector G. Rodriguez, Marcus Rohrbach

cs.CV2016

Attributes as Semantic Units between Natural Language and Visual Recognition

Marcus Rohrbach

cs.CV2025

V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts

Adnen Abdessaied, Anna Rohrbach, Marcus Rohrbach +1

cs.CV2025

Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection

Reihaneh Zohrabi, Hosein Hasani, Mahdieh Soleymani Baghshah +3

cs.CV2016

Segmentation from Natural Language Expressions

Ronghang Hu, Marcus Rohrbach, Trevor Darrell

cs.CV2022

FLAVA: A Foundational Language And Vision Alignment Model

Amanpreet Singh, Ronghang Hu, Vedanuj Goswami +4

cs.CV2019

CoDraw: Collaborative Drawing as a Testbed for Grounded Goal-driven Communication

Jin-Hwa Kim, Nikita Kitaev, Xinlei Chen +5

cs.CV2016

Long-term Recurrent Convolutional Networks for Visual Recognition and Description

Jeff Donahue, Lisa Anne Hendricks, Marcus Rohrbach +4

cs.LG2019

Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering

Ramakrishna Vedantam, Karan Desai, Stefan Lee +3

cs.CV2018

Exploring the Challenges towards Lifelong Fact Learning

Mohamed Elhoseiny, Francesca Babiloni, Rahaf Aljundi +3

cs.AI2026

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

Tobias Braun, Jonas Grebe, Louis Rethfeld +1

cs.CV2020

SMART Frame Selection for Action Recognition

Shreyank N Gowda, Marcus Rohrbach, Laura Sevilla-Lara

cs.CV2021

Remembering for the Right Reasons: Explanations Reduce Catastrophic Forgetting

Sayna Ebrahimi, Suzanne Petryk, Akash Gokul +4

cs.CV2026

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan +1

cs.CV2022

Learn2Augment: Learning to Composite Videos for Data Augmentation in Action Recognition

Shreyank N Gowda, Marcus Rohrbach, Frank Keller +1

cs.CV2016

Modeling Relationships in Referential Expressions with Compositional Modular Networks

Ronghang Hu, Marcus Rohrbach, Jacob Andreas +2

cs.LG2020

Adversarial Continual Learning

Sayna Ebrahimi, Franziska Meier, Roberto Calandra +2