NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (64)

cs.SD2023

HuBERTopic: Enhancing Semantic Representation of HuBERT through Self-supervision Utilizing Topic Model

Takashi Maekaku, Jiatong Shi, Xuankai Chang +2

cs.CL2022

SUPERB @ SLT 2022: Challenge on Generalization and Efficiency of Self-Supervised Speech Representation Learning

Tzu-hsun Feng, Annie Dong, Ching-Feng Yeh +11

eess.AS2020

ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration

Chenda Li, Jing Shi, Wangyou Zhang +8

cs.CL2023

AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head

Rongjie Huang, Mingze Li, Dongchao Yang +10

cs.CL2023

Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute

William Chen, Xuankai Chang, Yifan Peng +3

cs.SD2024

UniAudio: An Audio Foundation Model Toward Universal Audio Generation

Dongchao Yang, Jinchuan Tian, Xu Tan +9

cs.CL2021

SUPERB: Speech processing Universal PERformance Benchmark

Shu-wen Yang, Po-Han Chi, Yung-Sung Chuang +17

cs.SD2024

The Interspeech 2024 Challenge on Speech Processing Using Discrete Units

Xuankai Chang, Jiatong Shi, Jinchuan Tian +7

cs.LG2025

Apple Intelligence Foundation Language Models: Tech Report 2025

Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395

eess.AS2022

End-to-End Multi-speaker ASR with Independent Vector Analysis

Robin Scheibler, Wangyou Zhang, Xuankai Chang +2

cs.SD2022

Extended Graph Temporal Classification for Multi-Speaker End-to-End ASR

Xuankai Chang, Niko Moritz, Takaaki Hori +2

cs.SD2020

CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings

Shinji Watanabe, Michael Mandel, Jon Barker +18

cs.CL2022

A Study on the Integration of Pre-trained SSL, ASR, LM and SLU Models for Spoken Language Understanding

Yifan Peng, Siddhant Arora, Yosuke Higuchi +6

eess.AS2025

Data-Centric Lessons To Improve Speech-Language Pretraining

Vishaal Udandarao, Zhiyun Lu, Xuankai Chang +6

cs.SD2023

Improving Perceptual Quality, Intelligibility, and Acoustics on VoIP Platforms

Joseph Konan, Ojas Bhargave, Shikhar Agnihotri +12

cs.CL2023

Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study

Xuankai Chang, Brian Yan, Kwanghee Choi +14

eess.AS2025

Recent Trends in Distant Conversational Speech Recognition: A Review of CHiME-7 and 8 DASR Challenges

Samuele Cornell, Christoph Boeddeker, Taejin Park +9

cs.CL2025

TMT: Tri-Modal Translation between Speech, Image, and Text by Processing Different Modalities as Different Languages

Minsu Kim, Jee-weon Jung, Hyeongseop Rha +5

cs.SD2017

Recognizing Multi-talker Speech with Permutation Invariant Training

Dong Yu, Xuankai Chang, Yanmin Qian

cs.CL2023

Joint Prediction and Denoising for Large-scale Multilingual Self-supervised Learning

William Chen, Jiatong Shi, Brian Yan +6

eess.AS2021

Streaming End-to-End ASR based on Blockwise Non-Autoregressive Models

Tianzi Wang, Yuya Fujita, Xuankai Chang +1

cs.SD2022

Discretization and Re-synthesis: an alternative method to solve the Cocktail Party Problem

Jing Shi, Xuankai Chang, Tomoki Hayashi +3

eess.AS2023

The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios

Samuele Cornell, Matthew Wiesner, Shinji Watanabe +8

cs.SD2017

Single-Channel Multi-talker Speech Recognition with Permutation Invariant Training

Yanmin Qian, Xuankai Chang, Dong Yu

cs.SD2024

ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets

Jiatong Shi, Shih-Heng Wang, William Chen +8

eess.AS2024

Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks

Soumi Maiti, Yifan Peng, Shukjae Choi +3

cs.SD2022

End-to-End Integration of Speech Recognition, Dereverberation, Beamforming, and Self-Supervised Learning Representation

Yoshiki Masuyama, Xuankai Chang, Samuele Cornell +2

cs.CL2024

Towards Robust Speech Representation Learning for Thousands of Languages

William Chen, Wangyou Zhang, Yifan Peng +7

eess.AS2020

Recent Developments on ESPnet Toolkit Boosted by Conformer

Pengcheng Guo, Florian Boyer, Xuankai Chang +12

cs.CL2022

Two-Pass Low Latency End-to-End Spoken Language Understanding

Siddhant Arora, Siddharth Dalmia, Xuankai Chang +3

eess.AS2022

Joint Speech Recognition and Audio Captioning

Chaitanya Narisetty, Emiru Tsunoo, Xuankai Chang +3

eess.AS2020

The 2020 ESPnet update: new features, broadened applications, performance improvements, and future plans

Shinji Watanabe, Florian Boyer, Xuankai Chang +12

eess.AS2019

MIMO-SPEECH: End-to-End Multi-Channel Multi-Speaker Speech Recognition

Xuankai Chang, Wangyou Zhang, Yanmin Qian +2

eess.AS2020

Investigation of End-To-End Speaker-Attributed ASR for Continuous Multi-Talker Recordings

Naoyuki Kanda, Xuankai Chang, Yashesh Gaur +4

eess.AS2023

A New Benchmark of Aphasia Speech Recognition and Detection Based on E-Branchformer and Multi-task Learning

Jiyang Tang, William Chen, Xuankai Chang +2

eess.AS2020

End-to-End Multi-speaker Speech Recognition with Transformer

Xuankai Chang, Wangyou Zhang, Yanmin Qian +2

cs.CL2023

Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing

Brian Yan, Xuankai Chang, Antonios Anastasopoulos +2

cs.SD2023

Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning

Xuankai Chang, Brian Yan, Yuya Fujita +2

eess.AS2024

LV-CTC: Non-autoregressive ASR with CTC and latent variable models

Yuya Fujita, Shinji Watanabe, Xuankai Chang +1

eess.AS2024

The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization

Samuele Cornell, Taejin Park, Steve Huang +6

cs.SD2025

Findings of the 2023 ML-SUPERB Challenge: Pre-Training and Evaluation over More Languages and Beyond

Jiatong Shi, William Chen, Dan Berrebbi +10

eess.AS2020

End-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming

Wangyou Zhang, Aswin Shanmugam Subramanian, Xuankai Chang +2

cs.SD2023

Exploring the Integration of Speech Separation and Recognition with Self-Supervised Learning Representation

Yoshiki Masuyama, Xuankai Chang, Wangyou Zhang +5

cs.CL2022

SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities

Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang +14

cs.CL2022

ESPnet-SLU: Advancing Spoken Language Understanding through ESPnet

Siddhant Arora, Siddharth Dalmia, Pavel Denisov +10

cs.SD2021

Hypothesis Stitcher for End-to-End Speaker-attributed ASR on Long-form Multi-talker Recordings

Xuankai Chang, Naoyuki Kanda, Yashesh Gaur +3

eess.AS2021

Multi-Speaker ASR Combining Non-Autoregressive Conformer CTC and Conditional Speaker Chain

Pengcheng Guo, Xuankai Chang, Shinji Watanabe +1

cs.SD2022

End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation

Xuankai Chang, Takashi Maekaku, Yuya Fujita +1

cs.SD2024

Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation

Shih-Lun Wu, Xuankai Chang, Gordon Wichern +4

cs.CL2018

End-to-End Monaural Multi-speaker ASR System without Pretraining

Xuankai Chang, Yanmin Qian, Kai Yu +1

cs.CL2021

An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition

Xuankai Chang, Takashi Maekaku, Pengcheng Guo +8

eess.AS2022

ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding

Yen-Ju Lu, Xuankai Chang, Chenda Li +10

cs.SD2022

Muskits: an End-to-End Music Processing Toolkit for Singing Voice Synthesis

Jiatong Shi, Shuai Guo, Tao Qian +9

cs.CL2023

Reproducing Whisper-Style Training Using an Open-Source Toolkit and Publicly Available Data

Yifan Peng, Jinchuan Tian, Brian Yan +13

cs.SD2022

Speech Representation Learning Combining Conformer CPC with Deep Cluster for the ZeroSpeech Challenge 2021

Takashi Maekaku, Xuankai Chang, Yuya Fujita +3

cs.CL2024

OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer

Yifan Peng, Jinchuan Tian, William Chen +9

cs.SD2023

TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript-Conditioned Speech Separation and Recognition

Hakan Erdogan, Scott Wisdom, Xuankai Chang +4

eess.AS2022

Towards Low-distortion Multi-channel Speech Enhancement: The ESPNet-SE Submission to The L3DAS22 Challenge

Yen-Ju Lu, Samuele Cornell, Xuankai Chang +5

eess.AS2020

Sequence to Multi-Sequence Learning via Conditional Chain Mapping for Mixture Signals

Jing Shi, Xuankai Chang, Pengcheng Guo +5

cs.SD2025

ML-SUPERB: Multilingual Speech Universal PERformance Benchmark

Jiatong Shi, Dan Berrebbi, William Chen +8

eess.AS2024

SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data

Yichen Lu, Jiaqi Song, Xuankai Chang +3

eess.AS2024

SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR

Pengcheng Guo, Xuankai Chang, Hang Lv +2

eess.AS2024

Robust Audiovisual Speech Recognition Models with Mixture-of-Experts

Yihan Wu, Yifan Peng, Yichen Lu +3

eess.AS2024

A Large-Scale Evaluation of Speech Foundation Models

Shu-wen Yang, Heng-Jui Chang, Zili Huang +18