Publications (28)
AlloVera: A Multilingual Allophone Database
David R. Mortensen, Xinjian Li, Patrick Littell +6
Towards Robust Speech Representation Learning for Thousands of Languages
William Chen, Wangyou Zhang, Yifan Peng +7
Revisiting Factorizing Aggregated Posterior in Learning Disentangled Representations
Ze Cheng, Juncheng Li, Chenxu Wang +4
Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Gheorghe Comanici, Eric Bieber, Mike Schaekermann +3431
Light-Emitting Diodes based on Metal Halide Perovskite and Perovskite Related Nanocrystals
Ying Liu, Zhuangzhuang Ma, Jibin Zhang +5
Multi-Faceted Hierarchical Multi-Task Learning for a Large Number of Tasks with Multi-dimensional Relations
Junning Liu, Zijie Xia, Yu Lei +2
Acoustics Based Intent Recognition Using Discovered Phonetic Units for Low Resource Languages
Akshat Gupta, Xinjian Li, Sai Krishna Rallabandi +1
Universal Phone Recognition with a Multilingual Allophone System
Xinjian Li, Siddharth Dalmia, Juncheng Li +8
Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining
Takaaki Saeki, Soumi Maiti, Xinjian Li +3
Real-time Neural-based Input Method
Jiali Yao, Raphael Shu, Xinjian Li +2
Adversarial Music: Real World Audio Adversary Against Wake-word Detection System
Juncheng B. Li, Shuhui Qu, Xinjian Li +3
Reproducing Whisper-Style Training Using an Open-Source Toolkit and Publicly Available Data
Yifan Peng, Jinchuan Tian, Brian Yan +13
YODAS: Youtube-Oriented Dataset for Audio and Speech
Xinjian Li, Shinnosuke Takamichi, Takaaki Saeki +3
Multilingual Speech Recognition with Corpus Relatedness Sampling
Xinjian Li, Siddharth Dalmia, Alan W. Black +1
A Summary of the First Workshop on Language Technology for Language Documentation and Revitalization
Graham Neubig, Shruti Rijhwani, Alexis Palmer +21
The ARIEL-CMU Systems for LoReHLT18
Aditi Chaudhary, Siddharth Dalmia, Junjie Hu +27
Textless Direct Speech-to-Speech Translation with Discrete Speech Representation
Xinjian Li, Ye Jia, Chung-Cheng Chiu
On Prosody Modeling for ASR+TTS based Voice Conversion
Wen-Chin Huang, Tomoki Hayashi, Xinjian Li +2
Towards Zero-shot Learning for Automatic Phonemic Transcription
Xinjian Li, Siddharth Dalmia, David R. Mortensen +3
Phoneme Level Language Models for Sequence Based Low Resource ASR
Siddharth Dalmia, Xinjian Li, Alan W Black +1
ASR2K: Speech Recognition for Around 2000 Languages without Audio
Xinjian Li, Florian Metze, David R Mortensen +2
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Gemini Team, Petko Georgiev, Ving Ian Lei +1132
On Adversarial Robustness of Large-scale Audio Visual Learning
Juncheng B Li, Shuhui Qu, Xinjian Li +2
SANTLR: Speech Annotation Toolkit for Low Resource Languages
Xinjian Li, Zhong Zhou, Siddharth Dalmia +2
Phoneme Recognition through Fine Tuning of Phonetic Representations: a Case Study on Luhya Language Varieties
Kathleen Siminyu, Xinjian Li, Antonios Anastasopoulos +3
Semi-Supervised Recognition under a Noisy and Fine-grained Dataset
Cheng Cui, Zhi Ye, Yangxi Li +7
Domain Robust Feature Extraction for Rapid Low Resource ASR Development
Siddharth Dalmia, Xinjian Li, Florian Metze +1
Tusom2021: A Phonetically Transcribed Speech Dataset from an Endangered Language for Universal Phone Recognition Experiments
David R. Mortensen, Jordan Picone, Xinjian Li +1