Publications (184)
How to Train your Quadrotor: A Framework for Consistently Smooth and Responsive Flight Control via Reinforcement Learning
Siddharth Mysore, Bassel Mabsout, Kate Saenko +1
Revisiting Few-shot Activity Detection with Class Similarity Control
Huijuan Xu, Ximeng Sun, Eric Tzeng +3
OpenMatch: Open-set Consistency Regularization for Semi-supervised Learning with Outliers
Kuniaki Saito, Donghyun Kim, Kate Saenko
SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models
Kevin Miller, Samarth Mishra, Aditya Gangrade +2
Adversarial Discriminative Domain Adaptation
Eric Tzeng, Judy Hoffman, Kate Saenko +1
Many-to-many Splatting for Efficient Video Frame Interpolation
Ping Hu, Simon Niklaus, Stan Sclaroff +1
Moment Matching for Multi-Source Domain Adaptation
Xingchao Peng, Qinxun Bai, Xide Xia +3
Improving LSTM-based Video Description with Linguistic Knowledge Mined from Text
Subhashini Venugopalan, Lisa Anne Hendricks, Raymond Mooney +1
A Broad Study of Pre-training for Domain Generalization and Adaptation
Donghyun Kim, Kaihong Wang, Stan Sclaroff +1
Toward Driving Scene Understanding: A Dataset for Learning Driver Behavior and Causal Reasoning
Vasili Ramanishka, Yi-Ting Chen, Teruhisa Misu +1
Prefix Conditioning Unifies Language and Label Supervision
Kuniaki Saito, Kihyuk Sohn, Xiang Zhang +4
WikiWeb2M: A Page-Level Multimodal Wikipedia Dataset
Andrea Burns, Krishna Srinivasan, Joshua Ainslie +5
Fine-to-coarse Knowledge Transfer For Low-Res Image Classification
Xingchao Peng, Judy Hoffman, Stella X. Yu +1
VisDA-2021 Competition Universal Domain Adaptation to Improve Performance on Out-of-Distribution Data
Dina Bashkirova, Dan Hendrycks, Donghyun Kim +5
Hierarchical Reinforcement Learning with Hindsight
Andrew Levy, Robert Platt, Kate Saenko
Modeling Relationships in Referential Expressions with Compositional Modular Networks
Ronghang Hu, Marcus Rohrbach, Jacob Andreas +2
CyCADA: Cycle-Consistent Adversarial Domain Adaptation
Judy Hoffman, Eric Tzeng, Taesung Park +5
SLANT: Spurious Logo ANalysis Toolkit
Maan Qraitem, Piotr Teterwak, Kate Saenko +1
High precision grasp pose detection in dense clutter
Marcus Gualtieri, Andreas ten Pas, Kate Saenko +1
A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility
Andrea Burns, Deniz Arsan, Sanjna Agrawal +3
Language Features Matter: Effective Language Representations for Vision-Language Tasks
Andrea Burns, Reuben Tan, Kate Saenko +2
Learning from Lexical Perturbations for Consistent Visual Question Answering
Spencer Whitehead, Hui Wu, Yi Ren Fung +3
Self-supervised Visual Attribute Learning for Fashion Compatibility
Donghyun Kim, Kuniaki Saito, Samarth Mishra +3
MULE: Multimodal Universal Language Embedding
Donghyun Kim, Kuniaki Saito, Kate Saenko +2
Adversarial Self-Defense for Cycle-Consistent GANs
Dina Bashkirova, Ben Usman, Kate Saenko
Learning to Reason: End-to-End Module Networks for Visual Question Answering
Ronghang Hu, Jacob Andreas, Marcus Rohrbach +2
Simultaneous Deep Transfer Across Domains and Tasks
Eric Tzeng, Judy Hoffman, Trevor Darrell +1
AdaMML: Adaptive Multi-Modal Learning for Efficient Video Recognition
Rameswar Panda, Chun-Fu Chen, Quanfu Fan +4
Multilevel Language and Vision Integration for Text-to-Clip Retrieval
Huijuan Xu, Kun He, Bryan A. Plummer +3
Is Large-Scale Pretraining the Secret to Good Domain Generalization?
Piotr Teterwak, Kuniaki Saito, Theodoros Tsiligkaridis +2
Language-Conditioned Graph Networks for Relational Reasoning
Ronghang Hu, Anna Rohrbach, Trevor Darrell +1
Deep Domain Confusion: Maximizing for Domain Invariance
Eric Tzeng, Judy Hoffman, Ning Zhang +2
LoGAN: Latent Graph Co-Attention Network for Weakly-Supervised Video Moment Retrieval
Reuben Tan, Huijuan Xu, Kate Saenko +1
ZeroWaste Dataset: Towards Deformable Object Segmentation in Cluttered Scenes
Dina Bashkirova, Mohamed Abdelfattah, Ziliang Zhu +7
Mind the Backbone: Minimizing Backbone Distortion for Robust Object Detection
Kuniaki Saito, Donghyun Kim, Piotr Teterwak +2
Mobile App Tasks with Iterative Feedback (MoTIF): Addressing Task Feasibility in Interactive Visual Environments
Andrea Burns, Deniz Arsan, Sanjna Agrawal +3
Cross-Domain Image Manipulation by Demonstration
Ben Usman, Nick Dufour, Kate Saenko +1
Detecting Cross-Modal Inconsistency to Defend Against Neural Fake News
Reuben Tan, Bryan A. Plummer, Kate Saenko
Scaling Up Temporal Domain Generalization via Temporal Experts Averaging
Aoming Liu, Kevin Miller, Venkatesh Saligrama +4
Explainable Neural Computation via Stack Neural Module Networks
Ronghang Hu, Jacob Andreas, Trevor Darrell +1
Stable Distribution Alignment Using the Dual of the Adversarial Distance
Ben Usman, Kate Saenko, Brian Kulis
Domain2Vec: Domain Embedding for Unsupervised Domain Adaptation
Xingchao Peng, Yichen Li, Kate Saenko
Object Hallucination in Image Captioning
Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns +2
Web Artifact Attacks Disrupt Vision Language Models
Maan Qraitem, Piotr Teterwak, Kate Saenko +1
Temporal Action Detection with Multi-level Supervision
Baifeng Shi, Qi Dai, Judy Hoffman +3
Auxiliary Task Reweighting for Minimum-data Learning
Baifeng Shi, Judy Hoffman, Kate Saenko +2
Contrast and Mix: Temporal Contrastive Video Domain Adaptation with Background Mixing
Aadarsh Sahoo, Rutav Shah, Rameswar Panda +2
Deep Compositional Captioning: Describing Novel Object Categories without Paired Training Data
Lisa Anne Hendricks, Subhashini Venugopalan, Marcus Rohrbach +3
Return of Frustratingly Easy Domain Adaptation
Baochen Sun, Jiashi Feng, Kate Saenko
A Unified Framework for Domain Adaptive Pose Estimation
Donghyun Kim, Kaihong Wang, Kate Saenko +2
The Abduction of Sherlock Holmes: A Dataset for Visual Abductive Reasoning
Jack Hessel, Jena D. Hwang, Jae Sung Park +5
DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations
Ximeng Sun, Ping Hu, Kate Saenko
Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation
Maan Qraitem, Kate Saenko, Bryan A. Plummer
CLAMP: Contrastive LAnguage Model Prompt-tuning
Piotr Teterwak, Ximeng Sun, Bryan A. Plummer +2
RISE: Randomized Input Sampling for Explanation of Black-box Models
Vitali Petsiuk, Abir Das, Kate Saenko
An Introduction to Vision-Language Modeling
Florian Bordes, Richard Yuanzhe Pang, Anurag Ajay +38
Label Budget Allocation in Multi-Task Learning
Ximeng Sun, Kihyuk Sohn, Kate Saenko +2
Semi-Supervised Action Recognition with Temporal Contrastive Learning
Ankit Singh, Omprakash Chakraborty, Ashutosh Varshney +4
COLA: A Benchmark for Compositional Text-to-image Retrieval
Arijit Ray, Filip Radenovic, Abhimanyu Dubey +3
Women also Snowboard: Overcoming Bias in Captioning Models (Extended Abstract)
Lisa Anne Hendricks, Kaylee Burns, Kate Saenko +2
Two-Stream Region Convolutional 3D Network for Temporal Activity Detection
Huijuan Xu, Abir Das, Kate Saenko
Real-time Semantic Segmentation with Fast Attention
Ping Hu, Federico Perazzi, Fabian Caba Heilbron +4
TwoStreamVAN: Improving Motion Modeling in Video Generation
Ximeng Sun, Huijuan Xu, Kate Saenko
Exploring Consistency in Cross-Domain Transformer for Domain Adaptive Semantic Segmentation
Kaihong Wang, Donghyun Kim, Rogerio Feris +2
Why do These Match? Explaining the Behavior of Image Similarity Models
Bryan A. Plummer, Mariya I. Vasileva, Vitali Petsiuk +2
Class-imbalanced Domain Adaptation: An Empirical Odyssey
Shuhan Tan, Xingchao Peng, Kate Saenko
The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification
Dante Francisco Wasmuht, Otto Brookes, Maximillian Schall +21
AdaShare: Learning What To Share For Efficient Deep Multi-Task Learning
Ximeng Sun, Rameswar Panda, Rogerio Feris +1
Unsupervised Domain Generalization by Learning a Bridge Across Domains
Sivan Harary, Eli Schwartz, Assaf Arbelle +11
R-C3D: Region Convolutional 3D Network for Temporal Activity Detection
Huijuan Xu, Abir Das, Kate Saenko
Semi-supervised Domain Adaptation via Minimax Entropy
Kuniaki Saito, Donghyun Kim, Stan Sclaroff +2
Active Domain Adaptation via Clustering Uncertainty-weighted Embeddings
Viraj Prabhu, Arjun Chandrasekaran, Kate Saenko +1
Captioning Images with Diverse Objects
Subhashini Venugopalan, Lisa Anne Hendricks, Marcus Rohrbach +3
MaskSketch: Unpaired Structure-guided Masked Image Generation
Dina Bashkirova, Jose Lezama, Kihyuk Sohn +2
Adversarial Dropout Regularization
Kuniaki Saito, Yoshitaka Ushiku, Tatsuya Harada +1
DIME-FM: DIstilling Multimodal and Efficient Foundation Models
Ximeng Sun, Pengchuan Zhang, Peizhao Zhang +3
AR-Net: Adaptive Frame Resolution for Efficient Action Recognition
Yue Meng, Chung-Ching Lin, Rameswar Panda +5
Hardwiring ViT Patch Selectivity into CNNs using Patch Mixing
Ariel N. Lee, Sarah Adel Bargal, Janavi Kasera +3
Learning a visuomotor controller for real world robotic grasping using simulated depth images
Ulrich Viereck, Andreas ten Pas, Kate Saenko +1
Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering
Huijuan Xu, Kate Saenko
Strong-Weak Distribution Alignment for Adaptive Object Detection
Kuniaki Saito, Yoshitaka Ushiku, Tatsuya Harada +1
Fine-grained Angular Contrastive Learning with Coarse Labels
Guy Bukchin, Eli Schwartz, Kate Saenko +4
Detector-Free Weakly Supervised Grounding by Separation
Assaf Arbelle, Sivan Doveh, Amit Alfassy +14
Koala: Key frame-conditioned long video-LLM
Reuben Tan, Ximeng Sun, Ping Hu +5
What Do Deep CNNs Learn About Objects?
Xingchao Peng, Baochen Sun, Karim Ali +1
SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data
Samarth Mishra, Kate Saenko, Venkatesh Saligrama
Evaluation of Correctness in Unsupervised Many-to-Many Image Translation
Dina Bashkirova, Ben Usman, Kate Saenko
Honey, I Shrunk The Actor: A Case Study on Preserving Performance with Smaller Actors in Actor-Critic RL
Siddharth Mysore, Bassel Mabsout, Renato Mancuso +1
Domain Agnostic Learning with Disentangled Representations
Xingchao Peng, Zijun Huang, Ximeng Sun +1
Spatio-Temporal Action Detection with Multi-Object Interaction
Huijuan Xu, Lizhi Yang, Stan Sclaroff +2
Adapting Deep Visuomotor Representations with Weak Pairwise Constraints
Eric Tzeng, Coline Devin, Judy Hoffman +5
Socratis: Are large multimodal models emotionally aware?
Katherine Deng, Arijit Ray, Reuben Tan +3
Long-term Recurrent Convolutional Networks for Visual Recognition and Description
Jeff Donahue, Lisa Anne Hendricks, Marcus Rohrbach +4
Video Frame Interpolation with Many-to-many Splatting and Spatial Selective Refinement
Ping Hu, Simon Niklaus, Lu Zhang +2
VisDA 2022 Challenge: Domain Adaptation for Industrial Waste Sorting
Dina Bashkirova, Samarth Mishra, Diala Lteif +16
SAM 3: Segment Anything with Concepts
Nicolas Carion, Laura Gustafson, Yuan-Ting Hu +35
Speaker-Follower Models for Vision-and-Language Navigation
Daniel Fried, Ronghang Hu, Volkan Cirik +7
Detector Discovery in the Wild: Joint Multiple Instance and Representation Learning
Judy Hoffman, Deepak Pathak, Trevor Darrell +1
Federated Adversarial Domain Adaptation
Xingchao Peng, Zijun Huang, Yizhe Zhu +1
BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models
Shengao Wang, Wenqi Wang, Zecheng Wang +20