activity
20242026
collaborators

5 papers

cs.LG2026

Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text

Hainan Xu, Vladimir Bataev, Travis M. Bartley +1

We propose Chunk-wise Attention Transducer (CHAT), a novel extension to RNN-T models that processes audio in fixed-size chunks while employing cross-attention within each chunk. Th…

eess.AS2025

Pushing the Limits of Beam Search Decoding for Transducer-based ASR models

Lilit Grigoryan, Vladimir Bataev, Andrei Andrusenko +3

Transducer models have emerged as a promising choice for end-to-end ASR systems, offering a balanced trade-off between recognition accuracy, streaming capabilities, and inference s…

cs.CL2025

Word Level Timestamp Generation for Automatic Speech Recognition and Translation

Ke Hu, Krishna Puvvada, Elena Rastorgueva +7

We introduce a data-driven approach for enabling word-level timestamp prediction in the Canary model. Accurate timestamp information is crucial for a variety of downstream tasks su…

cs.LG2025

WIND: Accelerated RNN-T Decoding with Windowed Inference for Non-blank Detection

Hainan Xu, Vladimir Bataev, Lilit Grigoryan +1

We propose Windowed Inference for Non-blank Detection (WIND), a novel strategy that significantly accelerates RNN-T inference without compromising model accuracy. During model infe…

cs.CL2024

Romanization Encoding For Multilingual ASR

Wen Ding, Fei Jia, Hainan Xu +3

We introduce romanization encoding for script-heavy languages to optimize multilingual and code-switching Automatic Speech Recognition (ASR) systems. By adopting romanization encod…