papers

Publications (68)

cs.CL2017

Learning Word-Like Units from Joint Audio-Visual Analysis

David Harwath, James R. Glass

cs.CL2022

SpeechCLIP: Integrating Speech with Pre-Trained Vision and Language Model

Yi-Jen Shih, Hsuan-Fu Wang, Heng-Jui Chang +3

eess.AS2022

Phoneme Segmentation Using Self-Supervised Speech Models

Luke Strgar, David Harwath

eess.AS2026

ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining

Anuj Diwan, Eunsol Choi, David Harwath

cs.CV2025

VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models

Kim Sung-Bin, Jeongsoo Choi, Puyuan Peng +3

cs.CV2024

SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos

Changan Chen, Kumar Ashutosh, Rohit Girdhar +2

cs.SD2022

Automated detection of foreground speech with wearable sensing in everyday home environments: A transfer learning approach

Dawei Liang, Zifan Xu, Yinuo Chen +3

eess.AS2025

Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs

Wei-Cheng Tseng, David Harwath

cs.CL2019

Transfer Learning from Audio-Visual Grounding to Speech Recognition

Wei-Ning Hsu, David Harwath, James Glass

eess.AS2025

Scaling Rich Style-Prompted Text-to-Speech Datasets

Anuj Diwan, Zhisheng Zheng, David Harwath +1

cs.CL2024

Textless Speech-to-Speech Translation With Limited Parallel Data

Anuj Diwan, Anirudh Srinivasan, David Harwath +1

eess.AS2023

Word Discovery in Visually Grounded, Self-Supervised Speech Models

Puyuan Peng, David Harwath

cs.CV2018

Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input

David Harwath, Adrià Recasens, Dídac Surís +3

eess.AS2022

Unsupervised Fine-Tuning Data Selection for ASR Using Self-Supervised Speech Models

Reem Gody, David Harwath

cs.CL2018

Vision as an Interlingua: Learning Multilingual Semantic Embeddings of Untranscribed Speech

David Harwath, Galen Chuang, James Glass

cs.CL2026

Linear Script Representations in Speech Foundation Models Enable Zero-Shot Transliteration

Ryan Soh-Eun Shim, Kwanghee Choi, Kalvin Chang +8

eess.AS2024

AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models

Yuan Tseng, Layne Berry, Yi-Ting Chen +16

cs.CV2025

FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling

Kim Sung-Bin, Joohyun Chang, David Harwath +1

eess.AS2022

MAE-AST: Masked Autoencoding Audio Spectrogram Transformer

Alan Baade, Puyuan Peng, David Harwath

cs.LG2017

Learning Modality-Invariant Representations for Speech and Images

Kenneth Leidal, David Harwath, James Glass

cs.SD2025

How to Learn a New Language? An Efficient Solution for Self-Supervised Learning Models Unseen Languages Adaption in Low-Resource Scenario

Shih-Heng Wang, Zih-Ching Chen, Jiatong Shi +6

eess.AS2024

Self-supervised Speech Models for Word-Level Stuttered Speech Detection

Yi-Jen Shih, Zoi Gkalitsiou, Alexandros G. Dimakis +1

eess.AS2025

VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation

Puyuan Peng, Shang-Wen Li, Abdelrahman Mohamed +1

eess.AS2022

Fast-Slow Transformer for Visually Grounding Speech

Puyuan Peng, David Harwath

cs.CL2024

SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data

Hsuan-Fu Wang, Yi-Jen Shih, Heng-Jui Chang +5

eess.AS2023

Syllable Discovery and Cross-Lingual Generalization in a Visually Grounded, Self-Supervised Speech Model

Puyuan Peng, Shang-Wen Li, Okko Räsänen +2

cs.CL2023

Audio-Visual Neural Syntax Acquisition

Cheng-I Jeff Lai, Freda Shi, Puyuan Peng +10

eess.AS2024

VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild

Puyuan Peng, Po-Yao Huang, Shang-Wen Li +2

eess.AS2024

Integrating Self-supervised Speech Model with Pseudo Word-level Targets from Visually-grounded Speech Model

Hung-Chieh Fang, Nai-Xuan Ye, Yi-Jen Shih +5

cs.CL2023

When to Use Efficient Self Attention? Profiling Text, Speech and Image Transformer Variants

Anuj Diwan, Eunsol Choi, David Harwath

eess.AS2025

BAT: Learning to Reason about Spatial Sounds with Large Language Models

Zhisheng Zheng, Puyuan Peng, Ziyang Ma +3

cs.CL2023

Comparison of Multilingual Self-Supervised and Weakly-Supervised Speech Pre-Training for Adaptation to Unseen Languages

Andrew Rouditchenko, Sameer Khurana, Samuel Thomas +6

eess.AS2025

MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence

Sonal Kumar, Šimon Sedláček, Vaibhavi Lokegaonkar +31

eess.AS2026

Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces

Kwanghee Choi, Eunjung Yeo, Cheol Jun Cho +2

cs.CL2023

Style-transfer based Speech and Audio-visual Scene Understanding for Robot Action Sequence Acquisition from Videos

Chiori Hori, Puyuan Peng, David Harwath +7

cs.CL2024

SyllableLM: Learning Coarse Semantic Units for Speech Language Models

Alan Baade, Puyuan Peng, David Harwath

eess.AS2025

VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing

Zhisheng Zheng, Puyuan Peng, Anuj Diwan +5

cs.CL2020

Text-Free Image-to-Speech Synthesis Using Learned Segmental Units

Wei-Ning Hsu, David Harwath, Christopher Song +1

cs.CV2024

Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos

Changan Chen, Puyuan Peng, Ami Baid +4

cs.SD2024

Interface Design for Self-Supervised Speech Models

Yi-Jen Shih, David Harwath

eess.AS2023

Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization

Puyuan Peng, Brian Yan, Shinji Watanabe +1

eess.AS2022

Self-Supervised Representation Learning for Speech Using Visual Grounding and Masked Language Modeling

Puyuan Peng, David Harwath

cs.CL2019

Towards Visually Grounded Sub-Word Speech Unit Discovery

David Harwath, James Glass

cs.CV2015

Deep Multimodal Semantic Embeddings for Speech and Images

David Harwath, James Glass

cs.MM2023

Contrastive Audio-Visual Masked Autoencoder

Yuan Gong, Andrew Rouditchenko, Alexander H. Liu +4

eess.AS2026

[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic

Kwanghee Choi, Eunjung Yeo, Cheol Jun Cho +2

cs.CL2023

M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for Multilingual Speech to Image Retrieval

Layne Berry, Yi-Jen Shih, Hsuan-Fu Wang +3

cs.CL2022

Why is Winoground Hard? Investigating Failures in Visuolinguistic Compositionality

Anuj Diwan, Layne Berry, Eunsol Choi +2

cs.CL2023

C2KD: Cross-Lingual Cross-Modal Knowledge Distillation for Multilingual Text-Video Retrieval

Andrew Rouditchenko, Yung-Sung Chuang, Nina Shvetsova +7

cs.CL2025

Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks

Chien-yu Huang, Wei-Chih Chen, Shu-wen Yang +77

cs.CL2025

Towards Unsupervised Speech Recognition at the Syllable-Level

Liming Wang, Junrui Ni, Kai-Wei Chang +4

cs.SD2023

Learning Audio-Visual Dereverberation

Changan Chen, Wei Sun, David Harwath +1

cs.CL2024

Measuring Sound Symbolism in Audio-visual Models

Wei-Cheng Tseng, Yi-Jen Shih, David Harwath +1

cs.CV2022

Everything at Once -- Multi-modal Fusion Transformer for Video Retrieval

Nina Shvetsova, Brian Chen, Andrew Rouditchenko +6

cs.CV2021

Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions

Mathew Monfort, SouYoung Jin, Alexander Liu +4

cs.CL2025

Rhapsody: A Dataset for Highlight Detection in Podcasts

Younghan Park, Anuj Diwan, David Harwath +1

eess.AS2026

RosettaSpeech: Zero-Shot Speech-to-Speech Translation without Parallel Speech

Zhisheng Zheng, Xiaohang Sun, Tuan Dinh +8

cs.CL2024

Multimodal Contextualized Semantic Parsing from Speech

Jordan Voas, Raymond Mooney, David Harwath

cs.CV2021

AVLnet: Learning Audio-Visual Language Representations from Instructional Videos

Andrew Rouditchenko, Angie Boggust, David Harwath +11

eess.AS2026

Phone Segmentation and Recognition through Phonological Activation Mapping

Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh +8

cs.CL2021

Cascaded Multilingual Audio-Visual Learning from Videos

Andrew Rouditchenko, Angie Boggust, David Harwath +8

cs.CL2020

Learning Hierarchical Discrete Linguistic Units from Visually-Grounded Speech

David Harwath, Wei-Ning Hsu, James Glass

eess.AS2022

Continual Learning for On-Device Speech Recognition using Disentangled Conformers

Anuj Diwan, Ching-Feng Yeh, Wei-Ning Hsu +4

cs.CV2021

Routing with Self-Attention for Multimodal Capsule Networks

Kevin Duarte, Brian Chen, Nina Shvetsova +7

cs.CV2021

Multimodal Clustering Networks for Self-supervised Learning from Unlabeled Videos

Brian Chen, Andrew Rouditchenko, Kevin Duarte +10

cs.CL2026

Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease

Abner Hernandez, Eunjung Yeo, Kwanghee Choi +12

eess.AS2025

Unifying Model and Layer Fusion for Speech Foundation Models

Yi-Jen Shih, David Harwath

eess.AS2025

Probing the Robustness Properties of Neural Speech Codecs

Wei-Cheng Tseng, David Harwath