papers

Publications (184)

cs.RO2021

How to Train your Quadrotor: A Framework for Consistently Smooth and Responsive Flight Control via Reinforcement Learning

Siddharth Mysore, Bassel Mabsout, Kate Saenko +1

cs.CV2020

Revisiting Few-shot Activity Detection with Class Similarity Control

Huijuan Xu, Ximeng Sun, Eric Tzeng +3

cs.CV2021

OpenMatch: Open-set Consistency Regularization for Semi-supervised Learning with Outliers

Kuniaki Saito, Donghyun Kim, Kate Saenko

cs.CV2025

SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models

Kevin Miller, Samarth Mishra, Aditya Gangrade +2

cs.CV2017

Adversarial Discriminative Domain Adaptation

Eric Tzeng, Judy Hoffman, Kate Saenko +1

cs.CV2022

Many-to-many Splatting for Efficient Video Frame Interpolation

Ping Hu, Simon Niklaus, Stan Sclaroff +1

cs.CV2019

Moment Matching for Multi-Source Domain Adaptation

Xingchao Peng, Qinxun Bai, Xide Xia +3

cs.CL2016

Improving LSTM-based Video Description with Linguistic Knowledge Mined from Text

Subhashini Venugopalan, Lisa Anne Hendricks, Raymond Mooney +1

cs.CV2022

A Broad Study of Pre-training for Domain Generalization and Adaptation

Donghyun Kim, Kaihong Wang, Stan Sclaroff +1

cs.CV2018

Toward Driving Scene Understanding: A Dataset for Learning Driver Behavior and Causal Reasoning

Vasili Ramanishka, Yi-Ting Chen, Teruhisa Misu +1

cs.CV2023

Prefix Conditioning Unifies Language and Label Supervision

Kuniaki Saito, Kihyuk Sohn, Xiang Zhang +4

cs.CL2023

WikiWeb2M: A Page-Level Multimodal Wikipedia Dataset

Andrea Burns, Krishna Srinivasan, Joshua Ainslie +5

cs.CV2016

Fine-to-coarse Knowledge Transfer For Low-Res Image Classification

Xingchao Peng, Judy Hoffman, Stella X. Yu +1

cs.LG2021

VisDA-2021 Competition Universal Domain Adaptation to Improve Performance on Out-of-Distribution Data

Dina Bashkirova, Dan Hendrycks, Donghyun Kim +5

cs.LG2019

Hierarchical Reinforcement Learning with Hindsight

Andrew Levy, Robert Platt, Kate Saenko

cs.CV2016

Modeling Relationships in Referential Expressions with Compositional Modular Networks

Ronghang Hu, Marcus Rohrbach, Jacob Andreas +2

cs.CV2017

CyCADA: Cycle-Consistent Adversarial Domain Adaptation

Judy Hoffman, Eric Tzeng, Taesung Park +5

cs.CV2024

SLANT: Spurious Logo ANalysis Toolkit

Maan Qraitem, Piotr Teterwak, Kate Saenko +1

cs.RO2017

High precision grasp pose detection in dense clutter

Marcus Gualtieri, Andreas ten Pas, Kate Saenko +1

cs.CL2022

A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility

Andrea Burns, Deniz Arsan, Sanjna Agrawal +3

cs.CV2019

Language Features Matter: Effective Language Representations for Vision-Language Tasks

Andrea Burns, Reuben Tan, Kate Saenko +2

cs.CV2020

Learning from Lexical Perturbations for Consistent Visual Question Answering

Spencer Whitehead, Hui Wu, Yi Ren Fung +3

cs.CV2021

Self-supervised Visual Attribute Learning for Fashion Compatibility

Donghyun Kim, Kuniaki Saito, Samarth Mishra +3

cs.CV2019

MULE: Multimodal Universal Language Embedding

Donghyun Kim, Kuniaki Saito, Kate Saenko +2

cs.CV2019

Adversarial Self-Defense for Cycle-Consistent GANs

Dina Bashkirova, Ben Usman, Kate Saenko

cs.CV2017

Learning to Reason: End-to-End Module Networks for Visual Question Answering

Ronghang Hu, Jacob Andreas, Marcus Rohrbach +2

cs.CV2015

Simultaneous Deep Transfer Across Domains and Tasks

Eric Tzeng, Judy Hoffman, Trevor Darrell +1

cs.CV2021

AdaMML: Adaptive Multi-Modal Learning for Efficient Video Recognition

Rameswar Panda, Chun-Fu Chen, Quanfu Fan +4

cs.CV2018

Multilevel Language and Vision Integration for Text-to-Clip Retrieval

Huijuan Xu, Kun He, Bryan A. Plummer +3

cs.CV2025

Is Large-Scale Pretraining the Secret to Good Domain Generalization?

Piotr Teterwak, Kuniaki Saito, Theodoros Tsiligkaridis +2

cs.CV2019

Language-Conditioned Graph Networks for Relational Reasoning

Ronghang Hu, Anna Rohrbach, Trevor Darrell +1

cs.CV2014

Deep Domain Confusion: Maximizing for Domain Invariance

Eric Tzeng, Judy Hoffman, Ning Zhang +2

cs.CV2020

LoGAN: Latent Graph Co-Attention Network for Weakly-Supervised Video Moment Retrieval

Reuben Tan, Huijuan Xu, Kate Saenko +1

cs.CV2022

ZeroWaste Dataset: Towards Deformable Object Segmentation in Cluttered Scenes

Dina Bashkirova, Mohamed Abdelfattah, Ziliang Zhu +7

cs.CV2023

Mind the Backbone: Minimizing Backbone Distortion for Robust Object Detection

Kuniaki Saito, Donghyun Kim, Piotr Teterwak +2

cs.CL2021

Mobile App Tasks with Iterative Feedback (MoTIF): Addressing Task Feasibility in Interactive Visual Environments

Andrea Burns, Deniz Arsan, Sanjna Agrawal +3

cs.LG2019

Cross-Domain Image Manipulation by Demonstration

Ben Usman, Nick Dufour, Kate Saenko +1

cs.AI2020

Detecting Cross-Modal Inconsistency to Defend Against Neural Fake News

Reuben Tan, Bryan A. Plummer, Kate Saenko

cs.LG2025

Scaling Up Temporal Domain Generalization via Temporal Experts Averaging

Aoming Liu, Kevin Miller, Venkatesh Saligrama +4

cs.CV2019

Explainable Neural Computation via Stack Neural Module Networks

Ronghang Hu, Jacob Andreas, Trevor Darrell +1

cs.LG2018

Stable Distribution Alignment Using the Dual of the Adversarial Distance

Ben Usman, Kate Saenko, Brian Kulis

cs.CV2020

Domain2Vec: Domain Embedding for Unsupervised Domain Adaptation

Xingchao Peng, Yichen Li, Kate Saenko

cs.CL2019

Object Hallucination in Image Captioning

Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns +2

cs.CV2025

Web Artifact Attacks Disrupt Vision Language Models

Maan Qraitem, Piotr Teterwak, Kate Saenko +1

cs.CV2021

Temporal Action Detection with Multi-level Supervision

Baifeng Shi, Qi Dai, Judy Hoffman +3

cs.LG2020

Auxiliary Task Reweighting for Minimum-data Learning

Baifeng Shi, Judy Hoffman, Kate Saenko +2

cs.CV2021

Contrast and Mix: Temporal Contrastive Video Domain Adaptation with Background Mixing

Aadarsh Sahoo, Rutav Shah, Rameswar Panda +2

cs.CV2016

Deep Compositional Captioning: Describing Novel Object Categories without Paired Training Data

Lisa Anne Hendricks, Subhashini Venugopalan, Marcus Rohrbach +3

cs.CV2015

Return of Frustratingly Easy Domain Adaptation

Baochen Sun, Jiashi Feng, Kate Saenko

cs.CV2022

A Unified Framework for Domain Adaptive Pose Estimation

Donghyun Kim, Kaihong Wang, Kate Saenko +2

cs.CV2022

The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning

Jack Hessel, Jena D. Hwang, Jae Sung Park +5

cs.CV2022

DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations

Ximeng Sun, Ping Hu, Kate Saenko

cs.CL2026

Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation

Maan Qraitem, Kate Saenko, Bryan A. Plummer

cs.CV2024

CLAMP: Contrastive LAnguage Model Prompt-tuning

Piotr Teterwak, Ximeng Sun, Bryan A. Plummer +2

cs.CV2018

RISE: Randomized Input Sampling for Explanation of Black-box Models

Vitali Petsiuk, Abir Das, Kate Saenko

cs.LG2024

An Introduction to Vision-Language Modeling

Florian Bordes, Richard Yuanzhe Pang, Anurag Ajay +38

cs.LG2023

Label Budget Allocation in Multi-Task Learning

Ximeng Sun, Kihyuk Sohn, Kate Saenko +2

cs.CV2021

Semi-Supervised Action Recognition with Temporal Contrastive Learning

Ankit Singh, Omprakash Chakraborty, Ashutosh Varshney +4

cs.CV2023

COLA: A Benchmark for Compositional Text-to-image Retrieval

Arijit Ray, Filip Radenovic, Abhimanyu Dubey +3

cs.CV2018

Women also Snowboard: Overcoming Bias in Captioning Models (Extended Abstract)

Lisa Anne Hendricks, Kaylee Burns, Kate Saenko +2

cs.CV2019

Two-Stream Region Convolutional 3D Network for Temporal Activity Detection

Huijuan Xu, Abir Das, Kate Saenko

cs.CV2020

Real-time Semantic Segmentation with Fast Attention

Ping Hu, Federico Perazzi, Fabian Caba Heilbron +4

cs.CV2020

TwoStreamVAN: Improving Motion Modeling in Video Generation

Ximeng Sun, Huijuan Xu, Kate Saenko

cs.CV2022

Exploring Consistency in Cross-Domain Transformer for Domain Adaptive Semantic Segmentation

Kaihong Wang, Donghyun Kim, Rogerio Feris +2

cs.CV2020

Why do These Match? Explaining the Behavior of Image Similarity Models

Bryan A. Plummer, Mariya I. Vasileva, Vitali Petsiuk +2

cs.LG2020

Class-imbalanced Domain Adaptation: An Empirical Odyssey

Shuhan Tan, Xingchao Peng, Kate Saenko

cs.CV2025

The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification

Dante Francisco Wasmuht, Otto Brookes, Maximillian Schall +21

cs.CV2020

AdaShare: Learning What To Share For Efficient Deep Multi-Task Learning

Ximeng Sun, Rameswar Panda, Rogerio Feris +1

cs.CV2022

Unsupervised Domain Generalization by Learning a Bridge Across Domains

Sivan Harary, Eli Schwartz, Assaf Arbelle +11

cs.CV2017

R-C3D: Region Convolutional 3D Network for Temporal Activity Detection

Huijuan Xu, Abir Das, Kate Saenko

cs.CV2019

Semi-supervised Domain Adaptation via Minimax Entropy

Kuniaki Saito, Donghyun Kim, Stan Sclaroff +2

cs.CV2021

Active Domain Adaptation via Clustering Uncertainty-weighted Embeddings

Viraj Prabhu, Arjun Chandrasekaran, Kate Saenko +1

cs.CV2017

Captioning Images with Diverse Objects

Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3

cs.CV2023

MaskSketch: Unpaired Structure-guided Masked Image Generation

Dina Bashkirova, Jose Lezama, Kihyuk Sohn +2

cs.CV2018

Adversarial Dropout Regularization

Kuniaki Saito, Yoshitaka Ushiku, Tatsuya Harada +1

cs.CV2023

DIME-FM: DIstilling Multimodal and Efficient Foundation Models

Ximeng Sun, Pengchuan Zhang, Peizhao Zhang +3

cs.CV2020

AR-Net: Adaptive Frame Resolution for Efficient Action Recognition

Yue Meng, Chung-Ching Lin, Rameswar Panda +5

cs.CV2023

Hardwiring ViT Patch Selectivity into CNNs using Patch Mixing

Ariel N. Lee, Sarah Adel Bargal, Janavi Kasera +3

cs.RO2017

Learning a visuomotor controller for real world robotic grasping using simulated depth images

Ulrich Viereck, Andreas ten Pas, Kate Saenko +1

cs.CV2016

Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering

Huijuan Xu, Kate Saenko

cs.CV2019

Strong-Weak Distribution Alignment for Adaptive Object Detection

Kuniaki Saito, Yoshitaka Ushiku, Tatsuya Harada +1

cs.CV2021

Fine-grained Angular Contrastive Learning with Coarse Labels

Guy Bukchin, Eli Schwartz, Kate Saenko +4

cs.CV2021

Detector-Free Weakly Supervised Grounding by Separation

Assaf Arbelle, Sivan Doveh, Amit Alfassy +14

cs.CV2024

Koala: Key frame-conditioned long video-LLM

Reuben Tan, Ximeng Sun, Ping Hu +5

cs.CV2015

What Do Deep CNNs Learn About Objects?

Xingchao Peng, Baochen Sun, Karim Ali +1

cs.CV2025

SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data

Samarth Mishra, Kate Saenko, Venkatesh Saligrama

cs.CV2021

Evaluation of Correctness in Unsupervised Many-to-Many Image Translation

Dina Bashkirova, Ben Usman, Kate Saenko

cs.LG2021

Honey, I Shrunk The Actor: A Case Study on Preserving Performance with Smaller Actors in Actor-Critic RL

Siddharth Mysore, Bassel Mabsout, Renato Mancuso +1

cs.CV2019

Domain Agnostic Learning with Disentangled Representations

Xingchao Peng, Zijun Huang, Ximeng Sun +1

cs.CV2020

Spatio-Temporal Action Detection with Multi-Object Interaction

Huijuan Xu, Lizhi Yang, Stan Sclaroff +2

cs.CV2017

Adapting Deep Visuomotor Representations with Weak Pairwise Constraints

Eric Tzeng, Coline Devin, Judy Hoffman +5

cs.AI2023

Socratis: Are large multimodal models emotionally aware?

Katherine Deng, Arijit Ray, Reuben Tan +3

cs.CV2016

Long-term Recurrent Convolutional Networks for Visual Recognition and Description

Jeff Donahue, Lisa Anne Hendricks, Marcus Rohrbach +4

cs.CV2023

Video Frame Interpolation with Many-to-many Splatting and Spatial Selective Refinement

Ping Hu, Simon Niklaus, Lu Zhang +2

cs.CV2023

VisDA 2022 Challenge: Domain Adaptation for Industrial Waste Sorting

Dina Bashkirova, Samarth Mishra, Diala Lteif +16

cs.CV2026

SAM 3: Segment Anything with Concepts

Nicolas Carion, Laura Gustafson, Yuan-Ting Hu +35

cs.CV2018

Speaker-Follower Models for Vision-and-Language Navigation

Daniel Fried, Ronghang Hu, Volkan Cirik +7

cs.CV2014

Detector Discovery in the Wild: Joint Multiple Instance and Representation Learning

Judy Hoffman, Deepak Pathak, Trevor Darrell +1

cs.CV2025

Federated Adversarial Domain Adaptation

Xingchao Peng, Zijun Huang, Yizhe Zhu +1

cs.CV2026

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

Shengao Wang, Wenqi Wang, Zecheng Wang +20