NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (22)

cs.CL2018

Streaming End-to-end Speech Recognition For Mobile Devices

Yanzhang He, Tara N. Sainath, Rohit Prabhavalkar +17

cs.CL2024

Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Gemini Team, Petko Georgiev, Ving Ian Lei +1132

eess.AS2023

UML: A Universal Monolingual Output Layer for Multilingual ASR

Chao Zhang, Bo Li, Tara N. Sainath +2

eess.AS2025

Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking

Siyin Wang, Zengrui Jin, Changli Tang +26

cs.SD2022

E2E Segmenter: Joint Segmenting and Decoding for Long-Form ASR

W. Ronny Huang, Shuo-yiin Chang, David Rybach +5

cs.CL2022

Turn-Taking Prediction for Natural Conversational Speech

Shuo-yiin Chang, Bo Li, Tara N. Sainath +4

eess.AS2022

Improving the fusion of acoustic and text representations in RNN-T

Chao Zhang, Bo Li, Zhiyun Lu +2

cs.SD2022

Unified End-to-End Speech Recognition and Endpointing for Fast and Efficient Speech Systems

Shaan Bijwadia, Shuo-yiin Chang, Bo Li +3

cs.CL2020

A Streaming On-Device End-to-End Model Surpassing Server-Side Conventional Model Quality and Latency

Tara N. Sainath, Yanzhang He, Bo Li +26

cs.CL2025

Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Gheorghe Comanici, Eric Bieber, Mike Schaekermann +3431

cs.CL2025

Gemini: A Family of Highly Capable Multimodal Models

Gemini Team, Rohan Anil, Sebastian Borgeaud +1340

eess.AS2020

Towards Fast and Accurate Streaming End-to-End ASR

Bo Li, Shuo-yiin Chang, Tara N. Sainath +4

eess.AS2021

FastEmit: Low-latency Streaming ASR with Sequence-level Emission Regularization

Jiahui Yu, Chung-Cheng Chiu, Bo Li +8

eess.AS2020

Personal VAD: Speaker-Conditioned Voice Activity Detection

Shaojin Ding, Quan Wang, Shuo-yiin Chang +2

eess.AS2022

Streaming End-to-End Multilingual Speech Recognition with Joint Language Identification

Chao Zhang, Bo Li, Tara Sainath +4

cs.SD2019

Deep Learning for Audio Signal Processing

Hendrik Purwins, Bo Li, Tuomas Virtanen +3

cs.CL2023

Semantic Segmentation with Bidirectional Language Models Improves Long-form ASR

W. Ronny Huang, Hao Zhang, Shankar Kumar +2

cs.CL2023

Text Injection for Capitalization and Turn-Taking Prediction in Speech Models

Shaan Bijwadia, Shuo-yiin Chang, Weiran Wang +3

eess.AS2024

Towards General-Purpose Text-Instruction-Guided Voice Conversion

Chun-Yi Kuan, Chen An Li, Tsu-Yuan Hsu +5

eess.AS2022

A Language Agnostic Multilingual Streaming On-Device ASR System

Bo Li, Tara N. Sainath, Ruoming Pang +9

cs.CL2022

Streaming Intended Query Detection using E2E Modeling for Continued Conversation

Shuo-yiin Chang, Guru Prakash, Zelin Wu +7

cs.SD2023

Improved Long-Form Speech Recognition by Jointly Modeling the Primary and Non-primary Speakers

Guru Prakash Arumugam, Shuo-yiin Chang, Tara N. Sainath +3