Publications (75)
Scalable Scene Flow from Point Clouds in the Real World
Philipp Jund, Chris Sweeney, Nichola Abdo +2
Reward Augmented Maximum Likelihood for Neural Structured Prediction
Mohammad Norouzi, Samy Bengio, Zhifeng Chen +4
MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks
Weicheng Kuo, AJ Piergiovanni, Dahun Kim +9
Repeating head-on collisions in an optical trap and the evaluation of spin-dependent interactions among neutral particles
Zhibing Li, Zhifeng Chen, Yanzhang He +1
SADA: Safe and Adaptive Aggregation of Multiple Black-Box Predictions in Semi-Supervised Learning
Jiawei Shan, Zhifeng Chen, Yiming Dong +2
Three-dimensional echo-shifted EPI with simultaneous blip-up and blip-down acquisitions for correcting geometric distortion
Kaibao Sun, Zhifeng Chen, Guangyu Dan +4
Apple Intelligence Foundation Language Models: Tech Report 2025
Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395
AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving
Zhuohan Li, Lianmin Zheng, Yinmin Zhong +8
Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning
Lianmin Zheng, Zhuohan Li, Hao Zhang +9
StarNet: Targeted Computation for Object Detection in Point Clouds
Jiquan Ngiam, Benjamin Caine, Wei Han +10
Tacotron: Towards End-to-End Speech Synthesis
Yuxuan Wang, RJ Skerry-Ryan, Daisy Stanton +11
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
Yanghao Li, Rui Qian, Bowen Pan +24
Lingvo: a Modular and Scalable Framework for Sequence-to-Sequence Modeling
Jonathan Shen, Patrick Nguyen, Yonghui Wu +88
LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech
Heiga Zen, Viet Dang, Rob Clark +5
CL-MRI: Self-Supervised Contrastive Learning to Improve the Accuracy of Undersampled MRI Reconstruction
Mevan Ekanayake, Zhifeng Chen, Mehrtash Harandi +2
3D-EPI Blip-Up/Down Acquisition (BUDA) with CAIPI and Joint Hankel Structured Low-Rank Reconstruction for Rapid Distortion-Free High-Resolution T2* Mapping
Zhifeng Chen, Congyu Liao, Xiaozhi Cao +12
Gmail Smart Compose: Real-Time Assisted Writing
Mia Xu Chen, Benjamin N Lee, Gagan Bansal +9
Massively Multilingual Neural Machine Translation in the Wild: Findings and Challenges
Naveen Arivazhagan, Ankur Bapna, Orhan Firat +10
No Need for a Lexicon? Evaluating the Value of the Pronunciation Lexica in End-to-End Models
Tara N. Sainath, Rohit Prabhavalkar, Shankar Kumar +9
Streaming Object Detection for 3-D Point Clouds
Wei Han, Zhengdong Zhang, Benjamin Caine +7
Hierarchical Generative Modeling for Controllable Speech Synthesis
Wei-Ning Hsu, Yu Zhang, Ron J. Weiss +9
Direct speech-to-speech translation with a sequence-to-sequence model
Ye Jia, Ron J. Weiss, Fadi Biadsy +4
GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding
Dmitry Lepikhin, HyoukJoong Lee, Yuanzhong Xu +6
BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition
Yu Zhang, Daniel S. Park, Wei Han +23
GLaM: Efficient Scaling of Language Models with Mixture-of-Experts
Nan Du, Yanping Huang, Andrew M. Dai +24
Brainformers: Trading Simplicity for Efficiency
Yanqi Zhou, Nan Du, Yanping Huang +12
LaMDA: Language Models for Dialog Applications
Romal Thoppilan, Daniel De Freitas, Jamie Hall +57
Computing Cliques and Cavities in Networks
Dinghua Shi, Zhifeng Chen, Xiang Sun +4
N-Grammer: Augmenting Transformers with latent n-grams
Aurko Roy, Rohan Anil, Guangda Lai +13
Building Machine Translation Systems for the Next Thousand Languages
Ankur Bapna, Isaac Caswell, Julia Kreutzer +21
Scene Transformer: A unified architecture for predicting multiple agent trajectories
Jiquan Ngiam, Benjamin Caine, Vijay Vasudevan +11
Autellix: An Efficient Serving Engine for LLM Agents as General Programs
Michael Luo, Xiaoxiang Shi, Colin Cai +8
Learning to Skip for Language Modeling
Dewen Zeng, Nan Du, Tao Wang +4
State-of-the-art Speech Recognition With Sequence-to-Sequence Models
Chung-Cheng Chiu, Tara N. Sainath, Yonghui Wu +11
Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Dongseong Hwang, Prasanth Yadla, Kaan Elgin +8
Hilbert: Recursively Building Formal Proofs with Informal Reasoning
Sumanth Varambally, Thomas Voice, Yanchao Sun +3
GSPMD: General and Scalable Parallelization for ML Computation Graphs
Yuanzhong Xu, HyoukJoong Lee, Dehao Chen +13
Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation
Yonghui Wu, Mike Schuster, Zhifeng Chen +28
Controlled Decoding from Language Models
Sidharth Mudgal, Jong Lee, Harish Ganapathy +10
3D-MAN: 3D Multi-frame Attention Network for Object Detection
Zetong Yang, Yin Zhou, Zhifeng Chen +1
Sequence-to-Sequence Models Can Directly Translate Foreign Speech
Ron J. Weiss, Jan Chorowski, Navdeep Jaitly +2
TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems
MartÃn Abadi, Ashish Agarwal, Paul Barham +37
Stylus: Automatic Adapter Selection for Diffusion Models
Michael Luo, Justin Wong, Brandon Trabucco +5
Inner core static tilt inferred from intradecadal oscillation in the Earth's rotation
Yachong An, Hao Ding, Zhifeng Chen +2
Gemini: A Family of Highly Capable Multimodal Models
Gemini Team, Rohan Anil, Sebastian Borgeaud +1340
GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism
Yanping Huang, Youlong Cheng, Ankur Bapna +8
Improving the Performance of Online Neural Transducer Models
Tara N. Sainath, Chung-Cheng Chiu, Rohit Prabhavalkar +4
TensorFlow: A system for large-scale machine learning
MartÃn Abadi, Paul Barham, Jianmin Chen +19
Computing persistent homology by spanning trees and critical simplices
Dinghua Shi, Zhifeng Chen, Chuang Ma +1
Google's Multilingual Neural Machine Translation System: Enabling Zero-Shot Translation
Melvin Johnson, Mike Schuster, Quoc V. Le +9
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
Di Feng, Kaixin Ma, Feng Nan +9
A comparison of end-to-end models for long-form speech recognition
Chung-Cheng Chiu, Wei Han, Yu Zhang +11
Minimum Word Error Rate Training for Attention-based Sequence-to-Sequence Models
Rohit Prabhavalkar, Tara N. Sainath, Yonghui Wu +4
Strong spin-oscillation of small spin-1 condensates caused by an inclined weak magnetic field
Yanzhang He, Zhifeng Chen, Zhibing Li +1
Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
Jonathan Shen, Ruoming Pang, Ron J. Weiss +10
SeCo-INR: Semantically Conditioned Implicit Neural Representations for Improved Medical Image Super-Resolution
Mevan Ekanayake, Zhifeng Chen, Gary Egan +2
PaLM 2 Technical Report
Rohan Anil, Andrew M. Dai, Orhan Firat +125
The Best of Both Worlds: Combining Recent Advances in Neural Machine Translation
Mia Xu Chen, Orhan Firat, Ankur Bapna +9
Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis
Ye Jia, Yu Zhang, Ron J. Weiss +8
Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning
Yu Zhang, Ron J. Weiss, Heiga Zen +6
A Streaming On-Device End-to-End Model Surpassing Server-Side Conventional Model Quality and Latency
Tara N. Sainath, Yanzhang He, Bo Li +26
Mixture-of-Experts with Expert Choice Routing
Yanqi Zhou, Tao Lei, Hanxiao Liu +7
An analysis of incorporating an external language model into a sequence-to-sequence model
Anjuli Kannan, Yonghui Wu, Patrick Nguyen +3
Scalability in Perception for Autonomous Driving: Waymo Open Dataset
Pei Sun, Henrik Kretzschmar, Xerxes Dotiwalla +22
Motion-Informed Deep Learning for Brain MR Image Reconstruction Framework
Zhifeng Chen, Kamlesh Pawar, Kh Tohidul Islam +3
Lifelong Language Pretraining with Distribution-Specialized Experts
Wuyang Chen, Yanqi Zhou, Nan Du +4
Noise2Music: Text-conditioned Music Generation with Diffusion Models
Qingqing Huang, Daniel S. Park, Tao Wang +12
Optimize Flip Angle Schedules In MR Fingerprinting Using Reinforcement Learning
Shenjun Zhong, Zhifeng Chen, Zhaolin Chen
Millimeter-Wave Propagation Modeling and Measurement
Zhijian Lin, Xiaojiang Du, Hsiao-Hwa Chen +3
Multi-Dialect Speech Recognition With A Single Sequence-To-Sequence Model
Bo Li, Tara N. Sainath, Khe Chai Sim +6
Pseudo-labeling for Scalable 3D Object Detection
Benjamin Caine, Rebecca Roelofs, Vijay Vasudevan +4
Massively Multilingual Shallow Fusion with Large Language Models
Ke Hu, Tara N. Sainath, Bo Li +7
Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model
Anjuli Kannan, Arindrima Datta, Tara N. Sainath +6
Physical-Layer Network Coding: An Efficient Technique for Wireless Communications
Pingping Chen, Zhaopeng Xie, Yi Fang +3
Effect of magnetic fields on the spin evolution of non-polarized 87Rb Bose-Einstein condensates
Zhifeng Chen, Chengguang Bao, Zhibing Li