papers

Publications (47)

eess.AS2022

Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR

Naoyuki Kanda, Xiong Xiao, Yashesh Gaur +4

cs.CL2021

Sequence-level self-learning with multiple hypotheses

Kenichi Kumatani, Dimitrios Dimitriadis, Yashesh Gaur +4

eess.AS2020

Minimum Bayes Risk Training for End-to-End Speaker-Attributed ASR

Naoyuki Kanda, Zhong Meng, Liang Lu +4

eess.AS2020

Internal Language Model Estimation for Domain-Adaptive End-to-End Speech Recognition

Zhong Meng, Sarangarajan Parthasarathy, Eric Sun +7

cs.CL2020

Minimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR

Hirofumi Inaguma, Yashesh Gaur, Liang Lu +2

cs.CL2017

Exploring Neural Transducers for End-to-End Speech Recognition

Eric Battenberg, Jitong Chen, Rewon Child +8

cs.CL2022

Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition

Zhong Meng, Yashesh Gaur, Naoyuki Kanda +4

cs.CL2017

Reducing Bias in Production Speech Models

Eric Battenberg, Rewon Child, Adam Coates +13

eess.AS2020

Investigation of End-To-End Speaker-Attributed ASR for Continuous Multi-Talker Recordings

Naoyuki Kanda, Xuankai Chang, Yashesh Gaur +4

eess.AS2020

Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of Any Number of Speakers

Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang +4

cs.SD2026

GSRM: Generative Speech Reward Model for Speech RLHF

Maohao Shen, Tejas Jayashankar, Osama Hanna +10

cs.CL2023

Token-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments

Sara Papi, Peidong Wang, Junkun Chen +3

eess.AS2026

Conversational Speech Naturalness Predictor

Anfeng Xu, Yashesh Gaur, Naoyuki Kanda +6

eess.AS2020

Domain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition

Zhong Meng, Jinyu Li, Yashesh Gaur +1

cs.CL2022

Streaming, fast and accurate on-device Inverse Text Normalization for Automatic Speech Recognition

Yashesh Gaur, Nick Kibre, Jian Xue +5

cs.LG2021

Dynamic Gradient Aggregation for Federated Domain Adaptation

Dimitrios Dimitriadis, Kenichi Kumatani, Robert Gmyr +2

eess.AS2020

On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition

Jinyu Li, Yu Wu, Yashesh Gaur +3

eess.AS2021

End-to-End Speaker-Attributed ASR with Transformer

Naoyuki Kanda, Guoli Ye, Yashesh Gaur +4

cs.CL2026

Latent Speech-Text Transformer

Yen-Ju Lu, Yashesh Gaur, Wei Zhou +8

cs.CL2024

COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning

Jing Pan, Jian Wu, Yashesh Gaur +4

eess.AS2022

Continuous Streaming Multi-Talker ASR with Dual-path Transducers

Desh Raj, Liang Lu, Zhuo Chen +2

eess.AS2023

On decoder-only architecture for speech-to-text and large language model integration

Jian Wu, Yashesh Gaur, Zhuo Chen +8

eess.AS2020

Exploring End-to-End Multi-channel ASR with Bias Information for Meeting Transcription

Xiaofei Wang, Naoyuki Kanda, Yashesh Gaur +3

cs.CL2024

Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time

Frank Seide, Morrie Doulaty, Yangyang Shi +3

eess.AS2020

Character-Aware Attention-Based End-to-End Speech Recognition

Zhong Meng, Yashesh Gaur, Jinyu Li +1

cs.CL2022

Large-Scale Streaming End-to-End Speech Translation with Neural Transducers

Jian Xue, Peidong Wang, Jinyu Li +2

eess.AS2021

Large-Scale Pre-Training of End-to-End Multi-Talker ASR for Meeting Transcription with Single Distant Microphone

Naoyuki Kanda, Guoli Ye, Yu Wu +5

eess.AS2024

Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition

Niko Moritz, Ruiming Xie, Yashesh Gaur +5

cs.CL2023

LAMASSU: Streaming Language-Agnostic Multilingual Speech Recognition and Translation Using Neural Transducers

Peidong Wang, Eric Sun, Jian Xue +5

cs.CL2019

Speaker Adaptation for Attention-Based End-to-End Speech Recognition

Zhong Meng, Yashesh Gaur, Jinyu Li +1

eess.AS2022

Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings

Naoyuki Kanda, Jian Wu, Yu Wu +7

cs.CL2023

VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation

Tianrui Wang, Long Zhou, Ziqiang Zhang +6

cs.SD2021

Hypothesis Stitcher for End-to-End Speaker-attributed ASR on Long-form Multi-talker Recordings

Xuankai Chang, Naoyuki Kanda, Yashesh Gaur +3

cs.CL2020

Serialized Output Training for End-to-End Overlapped Speech Recognition

Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang +2

eess.AS2022

Streaming Multi-Talker ASR with Token-Level Serialized Output Training

Naoyuki Kanda, Jian Wu, Yu Wu +7

eess.AS2021

A Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio

Naoyuki Kanda, Xiong Xiao, Jian Wu +6

cs.CL2025

Can Speech LLMs Think while Listening?

Yi-Jen Shih, Desh Raj, Chunyang Wu +6

cs.CL2023

Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation

Sara Papi, Peidong Wang, Junkun Chen +4

cs.LG2020

Federated Transfer Learning with Dynamic Gradient Aggregation

Dimitrios Dimitriadis, Kenichi Kumatani, Robert Gmyr +2

eess.AS2023

CTCBERT: Advancing Hidden-unit BERT with CTC Objectives

Ruchao Fan, Yiming Wang, Yashesh Gaur +1

eess.AS2022

Acoustic-aware Non-autoregressive Spell Correction with Mask Sample Decoding

Ruchao Fan, Guoli Ye, Yashesh Gaur +1

eess.AS2024

Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens

Jinzheng Zhao, Niko Moritz, Egor Lakomkin +7

eess.AS2020

Listen, Look and Deliberate: Visual context-aware speech recognition using pre-trained text-video representations

Shahram Ghorbani, Yashesh Gaur, Yu Shi +1

cs.CL2017

Robust Speech Recognition Using Generative Adversarial Networks

Anuroop Sriram, Heewoo Jun, Yashesh Gaur +1

eess.AS2021

Internal Language Model Training for Domain-Adaptive End-to-End Speech Recognition

Zhong Meng, Naoyuki Kanda, Yashesh Gaur +6

cs.AI2024

The Llama 3 Herd of Models

Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri +556

eess.AS2025

Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech

Wonjune Kang, Junteng Jia, Chunyang Wu +8