NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (15)

eess.AS2025

SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment

Shivam Mehta, Yingru Liu, Zhenyu Tang +6

cs.CL2024

Get Large Language Models Ready to Speak: A Late-fusion Approach for Speech Generation

Maohao Shen, Shun Zhang, Jilong Wu +5

cs.SD2026

Scaling Speech Tokenizers with Diffusion Autoencoders

Yuancheng Wang, Zhenyu Tang, Yun Wang +9

cs.SD2021

Transferring Voice Knowledge for Acoustic Event Detection: An Empirical Study

Dawei Liang, Yangyang Shi, Yun Wang +6

cs.CL2024

Transducer-Llama: Integrating LLMs into Streamable Transducer-based Speech Recognition

Keqi Deng, Jinxi Guo, Yingyi Ma +4

cs.CL2023

TODM: Train Once Deploy Many Efficient Supernet-Based RNN-T Compression For On-device ASR Models

Yuan Shangguan, Haichuan Yang, Danni Li +11

eess.AS2023

Multi-Head State Space Model for Speech Recognition

Yassir Fathullah, Chunyang Wu, Yuan Shangguan +8

cs.CL2025

Can Speech LLMs Think while Listening?

Yi-Jen Shih, Desh Raj, Chunyang Wu +6

cs.SD2022

Dynamic Speech Endpoint Detection with Regression Targets

Dawei Liang, Hang Su, Tarun Singh +5

eess.AS2023

Prompting Large Language Models with Speech Recognition Abilities

Yassir Fathullah, Chunyang Wu, Egor Lakomkin +9

eess.AS2024

Effective internal language model training and fusion for factorized transducer model

Jinxi Guo, Niko Moritz, Yingyi Ma +6

cs.SD2020

Emformer: Efficient Memory Transformer Based Acoustic Model For Low Latency Streaming Speech Recognition

Yangyang Shi, Yongqiang Wang, Chunyang Wu +5

eess.AS2021

Streaming Transformer Transducer Based Speech Recognition Using Non-Causal Convolution

Yangyang Shi, Chunyang Wu, Dilin Wang +9

cs.CL2024

AudioChatLlama: Towards General-Purpose Speech Abilities for LLMs

Yassir Fathullah, Chunyang Wu, Egor Lakomkin +7

eess.AS2021

On lattice-free boosted MMI training of HMM and CTC-based full-context ASR models

Xiaohui Zhang, Vimal Manohar, David Zhang +7