Publications (88)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
Nishad Singhi, Hritik Bansal, Arian Hosseini +4
Multimodal Explanations: Justifying Decisions and Pointing to the Evidence
Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata +4
Visual Coreference Resolution in Visual Dialog using Neural Module Networks
Satwik Kottur, José M. F. Moura, Devi Parikh +2
Learning to Reason: End-to-End Module Networks for Visual Question Answering
Ronghang Hu, Jacob Andreas, Marcus Rohrbach +2
KRISP: Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQA
Kenneth Marino, Xinlei Chen, Devi Parikh +2
Recognizing Fine-Grained and Composite Activities using Hand-Centric Features and Script Data
Marcus Rohrbach, Anna Rohrbach, Michaela Regneri +4
Learning to Generate Grounded Visual Captions without Localization Supervision
Chih-Yao Ma, Yannis Kalantidis, Ghassan AlRegib +3
Coherent Multi-Sentence Video Description with Variable Level of Detail
Anna Senina, Marcus Rohrbach, Wei Qiu +5
DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts
Tobias Braun, Mark Rothermel, Marcus Rohrbach +1
Obliviate: Erasing Concepts from Autoregressive Image Generation Models
Hossein Shakibania, Jonas Henry Grebe, Tobias Braun +4
VETO: Towards Protecting Images From Frontier AI Editing
Jonas Grebe, Hossein Shakibania, Tobias Braun +2
The paper presents VETO, a subtle anti-edit cloak that disrupts how modern diffusion-based image editors read source images, and introduces VetoBench, a benchmark for evaluating pr…
A Dataset for Movie Description
Anna Rohrbach, Marcus Rohrbach, Niket Tandon +1
Learning To Recognize Procedural Activities with Distant Supervision
Xudong Lin, Fabio Petroni, Gedas Bertasius +3
Attentive Explanations: Justifying Decisions and Pointing to the Evidence
Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata +3
Decoupling Representation and Classifier for Long-Tailed Recognition
Bingyi Kang, Saining Xie, Marcus Rohrbach +4
Movie Description
Anna Rohrbach, Atousa Torabi, Marcus Rohrbach +5
Spatial Semantic Regularisation for Large Scale Object Detection
Damian Mrowca, Marcus Rohrbach, Judy Hoffman +3
Chrono: A Simple Blueprint for Representing Time in MLLMs
Hector Rodriguez, Boris Meinardus, Anil Batra +2
Attentive Explanations: Justifying Decisions and Pointing to the Evidence (Extended Abstract)
Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata +4
Grounding of Textual Phrases in Images by Reconstruction
Anna Rohrbach, Marcus Rohrbach, Ronghang Hu +2
Calibrated Sampling-Free Uncertainty Estimation in Bayesian Deep Learning
Tobias Jan Wieczorek, Leon de Andrade, Thomas Möllenhoff +1
Reliable Visual Question Answering: Abstain Rather Than Answer Incorrectly
Spencer Whitehead, Suzanne Petryk, Vedaad Shakib +4
Improving Selective Visual Question Answering by Learning from Your Peers
Corentin Dancette, Spencer Whitehead, Rishabh Maheshwary +5
A Multi-scale Multiple Instance Video Description Network
Huijuan Xu, Subhashini Venugopalan, Vasili Ramanishka +2
Deep Compositional Captioning: Describing Novel Object Categories without Paired Training Data
Lisa Anne Hendricks, Subhashini Venugopalan, Marcus Rohrbach +3
Erased but Not Forgotten: How Backdoors Compromise Concept Erasure
Tobias Braun, Jonas Henry Grebe, Marcus Rohrbach +1
Uncertainty-guided Continual Learning with Bayesian Neural Networks
Sayna Ebrahimi, Mohamed Elhoseiny, Trevor Darrell +1
HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
Reihaneh Zohrabi, Hosein Hasani, Akshita Gupta +3
Sequence to Sequence -- Video to Text
Subhashini Venugopalan, Marcus Rohrbach, Jeff Donahue +3
The Long-Short Story of Movie Description
Anna Rohrbach, Marcus Rohrbach, Bernt Schiele
Geometric Erasure by Contrastive Velocity Matching in Rectified Flows
Jonas Henry Grebe, Tobias Braun, Anna Rohrbach +1
CLEVR-Dialog: A Diagnostic Dataset for Multi-Round Reasoning in Visual Dialog
Satwik Kottur, José M. F. Moura, Devi Parikh +2
Adversarial Inference for Multi-Sentence Video Description
Jae Sung Park, Marcus Rohrbach, Trevor Darrell +1
VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
Mark Rothermel, Marcus Kornmann, Marcus Rohrbach +1
Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs
Paul Jonas Kurz, Tobias Jan Wieczorek, Mohamed A. Abdelsalam +2
12-in-1: Multi-Task Vision and Language Representation Learning
Jiasen Lu, Vedanuj Goswami, Marcus Rohrbach +2
Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models
Tobias Braun, Jonas Henry Grebe, Hossein Shakibania +2
Ask Your Neurons: A Deep Learning Approach to Visual Question Answering
Mateusz Malinowski, Marcus Rohrbach, Mario Fritz
Learning to Compose Neural Networks for Question Answering
Jacob Andreas, Marcus Rohrbach, Trevor Darrell +1
Efficient Lifelong Learning with A-GEM
Arslan Chaudhry, Marc'Aurelio Ranzato, Marcus Rohrbach +1
Iterative Answer Prediction with Pointer-Augmented Multimodal Transformers for TextVQA
Ronghang Hu, Amanpreet Singh, Trevor Darrell +1
Natural Language Object Retrieval
Ronghang Hu, Huazhe Xu, Marcus Rohrbach +3
Simple Token-Level Confidence Improves Caption Correctness
Suzanne Petryk, Spencer Whitehead, Joseph E. Gonzalez +3
On Tiny Episodic Memories in Continual Learning
Arslan Chaudhry, Marcus Rohrbach, Mohamed Elhoseiny +4
Utilizing Large Scale Vision and Text Datasets for Image Segmentation from Referring Expressions
Ronghang Hu, Marcus Rohrbach, Subhashini Venugopalan +1
A New Split for Evaluating True Zero-Shot Action Recognition
Shreyank N Gowda, Laura Sevilla-Lara, Kiyoon Kim +2
Selfless Sequential Learning
Rahaf Aljundi, Marcus Rohrbach, Tinne Tuytelaars
Cycle-Consistency for Robust Visual Question Answering
Meet Shah, Xinlei Chen, Marcus Rohrbach +1
Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding
Akira Fukui, Dong Huk Park, Daylen Yang +3
Generating Descriptions with Grounded and Co-Referenced People
Anna Rohrbach, Marcus Rohrbach, Siyu Tang +2
Pythia v0.1: the Winning Entry to the VQA Challenge 2018
Yu Jiang, Vivek Natarajan, Xinlei Chen +3
Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution
Yunpeng Chen, Haoqi Fan, Bing Xu +5
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
Nishad Singhi, Christian Bialas, Snehal Jauhri +4
In Defense of Grid Features for Visual Question Answering
Huaizu Jiang, Ishan Misra, Marcus Rohrbach +2
TextCaps: a Dataset for Image Captioning with Reading Comprehension
Oleksii Sidorov, Ronghang Hu, Marcus Rohrbach +1
CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action Recognition
Shreyank N Gowda, Laura Sevilla-Lara, Frank Keller +1
Captioning Images with Diverse Objects
Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3
Generating Visual Explanations
Lisa Anne Hendricks, Zeynep Akata, Marcus Rohrbach +3
Memory Aware Synapses: Learning what (not) to forget
Rahaf Aljundi, Francesca Babiloni, Mohamed Elhoseiny +2
Large-Scale Visual Relationship Understanding
Ji Zhang, Yannis Kalantidis, Marcus Rohrbach +3
Translating Videos to Natural Language Using Deep Recurrent Neural Networks
Subhashini Venugopalan, Huijuan Xu, Jeff Donahue +3
ReCap: Lightweight Referential Grounding for Coherent Story Visualization
Aditya Arora, Akshita Gupta, Pau Rodriguez +1
Speaking the Same Language: Matching Machine to Human Captions by Adversarial Training
Rakshith Shetty, Marcus Rohrbach, Lisa Anne Hendricks +2
Grounded Video Description
Luowei Zhou, Yannis Kalantidis, Xinlei Chen +2
DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition
Zheng Shou, Xudong Lin, Yannis Kalantidis +4
Ask Your Neurons: A Neural-based Approach to Answering Questions about Images
Mateusz Malinowski, Marcus Rohrbach, Mario Fritz
Neural Module Networks
Jacob Andreas, Marcus Rohrbach, Trevor Darrell +1
Efficient Pre-training for Localized Instruction Generation of Videos
Anil Batra, Davide Moltisanti, Laura Sevilla-Lara +2
Graph-Based Global Reasoning Networks
Yunpeng Chen, Marcus Rohrbach, Zhicheng Yan +3
Towards VQA Models That Can Read
Amanpreet Singh, Vivek Natarajan, Meet Shah +5
Predicting Implicit Arguments in Procedural Video Instructions
Anil Batra, Laura Sevilla-Lara, Marcus Rohrbach +1
SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring
Hector G. Rodriguez, Marcus Rohrbach
Attributes as Semantic Units between Natural Language and Visual Recognition
Marcus Rohrbach
V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
Adnen Abdessaied, Anna Rohrbach, Marcus Rohrbach +1
Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection
Reihaneh Zohrabi, Hosein Hasani, Mahdieh Soleymani Baghshah +3
Segmentation from Natural Language Expressions
Ronghang Hu, Marcus Rohrbach, Trevor Darrell
FLAVA: A Foundational Language And Vision Alignment Model
Amanpreet Singh, Ronghang Hu, Vedanuj Goswami +4
CoDraw: Collaborative Drawing as a Testbed for Grounded Goal-driven Communication
Jin-Hwa Kim, Nikita Kitaev, Xinlei Chen +5
Long-term Recurrent Convolutional Networks for Visual Recognition and Description
Jeff Donahue, Lisa Anne Hendricks, Marcus Rohrbach +4
Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering
Ramakrishna Vedantam, Karan Desai, Stefan Lee +3
Exploring the Challenges towards Lifelong Fact Learning
Mohamed Elhoseiny, Francesca Babiloni, Rahaf Aljundi +3
Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating
Tobias Braun, Jonas Grebe, Louis Rethfeld +1
SMART Frame Selection for Action Recognition
Shreyank N Gowda, Marcus Rohrbach, Laura Sevilla-Lara
Remembering for the Right Reasons: Explanations Reduce Catastrophic Forgetting
Sayna Ebrahimi, Suzanne Petryk, Akash Gokul +4
Variational Visual Question Answering for Uncertainty-Aware Selective Prediction
Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan +1
Learn2Augment: Learning to Composite Videos for Data Augmentation in Action Recognition
Shreyank N Gowda, Marcus Rohrbach, Frank Keller +1
Modeling Relationships in Referential Expressions with Compositional Modular Networks
Ronghang Hu, Marcus Rohrbach, Jacob Andreas +2
Adversarial Continual Learning
Sayna Ebrahimi, Franziska Meier, Roberto Calandra +2