Publications (342)
Multi-Level Transfer Learning from Near-Field to Far-Field Speaker Verification
Li Zhang, Qing Wang, Kong Aik Lee +2
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
Rui Liu, Jiatian Xi, Ziyue Jiang +1
End-to-End Code-Switching ASR for Low-Resourced Language Pairs
Xianghu Yue, Grandee Lee, Emre Yılmaz +2
Bridging What the Model Thinks and How It Speaks: Expressive Speech Generation via Self-Aware Intent-Realization Alignment
Kuang Wang, Lai Wei, Ping Lin +8
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
Wenxuan Wu, Xueyuan Chen, Xixin Wu +2
Multi-Encoder-Decoder Transformer for Code-Switching Speech Recognition
Xinyuan Zhou, Emre Yılmaz, Yanhua Long +2
Ego4D: Around the World in 3,000 Hours of Egocentric Video
Kristen Grauman, Andrew Westbury, Eugene Byrne +82
Roadmap towards Superhuman Speech Understanding using Large Language Models
Fan Bu, Yuhao Zhang, Xidong Wang +3
The Attacker's Perspective on Automatic Speaker Verification: An Overview
Rohan Kumar Das, Xiaohai Tian, Tomi Kinnunen +1
RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems
Jingru Lin, Chen Zhang, Stephen Y. Liu +1
CrossTune: Black-Box Few-Shot Classification with Label Enhancement
Danqing Luo, Chen Zhang, Yan Zhang +1
HuatuoGPT, towards Taming Language Model to Be a Doctor
Hongbo Zhang, Junying Chen, Feng Jiang +10
NeuroHeed: Neuro-Steered Speaker Extraction using EEG Signals
Zexu Pan, Marvin Borsdorf, Siqi Cai +2
Quantized Spike-driven Transformer
Xuerui Qiu, Malu Zhang, Jieyuan Zhang +7
PoLyScriber: Integrated Fine-tuning of Extractor and Lyrics Transcriber for Polyphonic Music
Xiaoxue Gao, Chitralekha Gupta, Haizhou Li
S$^2$NN: Sub-bit Spiking Neural Networks
Wenjie Wei, Malu Zhang, Jieyuan Zhang +8
Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context
Junyi Ao, Dekun Chen, Xiaohai Tian +6
A Cost-Sensitive Deep Belief Network for Imbalanced Classification
Chong Zhang, Kay Chen Tan, Haizhou Li +1
RefXVC: Cross-Lingual Voice Conversion with Enhanced Reference Leveraging
Mingyang Zhang, Yi Zhou, Yi Ren +3
Transfer Learning from Speech Synthesis to Voice Conversion with Non-Parallel Training Data
Mingyang Zhang, Yi Zhou, Li Zhao +1
Ripple sparse self-attention for monaural speech enhancement
Qiquan Zhang, Hongxu Zhu, Qi Song +3
Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems
Siyuan Liu, Jiahui Xu, Feng Jiang +6
Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement
Jie Zhang, Qing-Tian Xu, Zhen-Hua Ling +1
Betray Oneself: A Novel Audio DeepFake Detection Model via Mono-to-Stereo Conversion
Rui Liu, Jinhua Zhang, Guanglai Gao +1
HLT-NUS SUBMISSION FOR 2020 NIST Conversational Telephone Speech SRE
Rohan Kumar Das, Ruijie Tao, Haizhou Li
EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis
Li Zhou, Hao Jiang, Junjie Li +2
Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet
Mingyang Zhang, Xin Wang, Fuming Fang +2
Rectified Linear Postsynaptic Potential Function for Backpropagation in Deep Spiking Neural Networks
Malu Zhang, Jiadong Wang, Burin Amornpaisannon +8
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
Qibing Bai, Sho Inoue, Shuai Wang +3
Quantifying Self-diagnostic Atomic Knowledge in Chinese Medical Foundation Model: A Computational Analysis
Yaxin Fan, Feng Jiang, Benyou Wang +2
Mixed-EVC: Mixed Emotion Synthesis and Control in Voice Conversion
Kun Zhou, Berrak Sisman, Carlos Busso +2
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
Junjie Li, Wenxuan Wu, Shuai Wang +4
PoE: a Panel of Experts for Generalized Automatic Dialogue Assessment
Chen Zhang, Luis Fernando D'Haro, Qiquan Zhang +2
Binary Event-Driven Spiking Transformer
Honglin Cao, Zijian Zhou, Wenjie Wei +6
Large-Scale Speaker Diarization of Radio Broadcast Archives
Emre Yılmaz, Adem Derinel, Zhou Kun +4
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
Simin Chen, Yiming Chen, Zexin Li +8
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
Yiming Chen, Xianghu Yue, Xiaoxue Gao +4
Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs
Zhenyu Liu, Xuanyu Zhang, Yunxin Li +10
The paper identifies gradient conflicts between acoustic and semantic modeling as the cause of modality interference in full-duplex spoken language models and proposes Lychee-FD, a…
Code-Switching Detection Using ASR-Generated Language Posteriors
Qinyi Wang, Emre Yılmaz, Adem Derinel +1
How Well Do Text Embedding Models Understand Syntax?
Yan Zhang, Zhaopeng Feng, Zhiyang Teng +2
Emotion Intensity and its Control for Emotional Voice Conversion
Kun Zhou, Berrak Sisman, Rajib Rana +2
Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech
Yihang Lin, Li Zhou, Congwei Cao +4
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
Xueyao Zhang, Liumeng Xue, Yicheng Gu +16
The NUS-HLT System for ICASSP2024 ICMC-ASR Grand Challenge
Meng Ge, Yizhou Peng, Yidi Jiang +6
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
Xuehao Zhou, Mingyang Zhang, Yi Zhou +2
CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data
Qibing Bai, Shuhao Shi, Shuai Wang +3
Automatic Lyrics Alignment and Transcription in Polyphonic Music: Does Background Music Help?
Chitralekha Gupta, Emre Yılmaz, Haizhou Li
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
Wenxuan Wu, Shuai Wang, Xixin Wu +2
DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language Models
Jiabao Pan, Yan Zhang, Chen Zhang +3
Fantastic 4 system for NIST 2015 Language Recognition Evaluation
Kong Aik Lee, Ville Hautamäki, Anthony Larcher +14
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
Ruijie Tao, Xinyuan Qian, Yidi Jiang +3
Deep Spiking Neural Networks for Large Vocabulary Automatic Speech Recognition
Jibin Wu, Emre Yilmaz, Malu Zhang +2
Aligning Language Models Using Follow-up Likelihood as Reward Signal
Chen Zhang, Dading Chong, Feng Jiang +4
EEG-Derived Voice Signature for Attended Speaker Detection
Hongxu Zhu, Siqi Cai, Yidi Jiang +2
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
Rui Liu, Pu Gao, Jiatian Xi +3
Human Demonstrations are Generalizable Knowledge for Robots
Te Cui, Tianxing Zhou, Zicai Peng +6
Genre-conditioned Acoustic Models for Automatic Lyrics Transcription of Polyphonic Music
Xiaoxue Gao, Chitralekha Gupta, Haizhou Li
A Multi-State Diagnosis and Prognosis Framework with Feature Learning for Tool Condition Monitoring
Chong Zhang, Geok Soon Hong, Jun-Hong Zhou +5
Advancing Topic Segmentation and Outline Generation in Chinese Texts: The Paragraph-level Topic Representation, Corpus, and Benchmark
Feng Jiang, Weihao Liu, Xiaomin Chu +3
NE-PADD: Leveraging Named Entity Knowledge for Robust Partial Audio Deepfake Detection via Attention Aggregation
Huhong Xian, Rui Liu, Berrak Sisman +1
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
Junjie Li, Ke Zhang, Shuai Wang +3
Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals
Meng Ge, Chenglin Xu, Longbiao Wang +3
Time-Frequency Attention for Monaural Speech Enhancement
Qiquan Zhang, Qi Song, Zhaoheng Ni +2
Serialized Multi-Layer Multi-Head Attention for Neural Speaker Embedding
Hongning Zhu, Kong Aik Lee, Haizhou Li
A Robust Multi-Scale Framework with Test-Time Adaptation for sEEG-Based Speech Decoding
Suli Wang, Yang-yang Li, Siqi Cai +1
sVAD: A Robust, Low-Power, and Light-Weight Voice Activity Detection with Spiking Neural Networks
Qu Yang, Qianhui Liu, Nan Li +3
Music-robust Automatic Lyrics Transcription of Polyphonic Music
Xiaoxue Gao, Chitralekha Gupta, Haizhou Li
MFA: TDNN with Multi-scale Frequency-channel Attention for Text-independent Speaker Verification with Short Utterances
Tianchi Liu, Rohan Kumar Das, Kong Aik Lee +1
token2vec: A Joint Self-Supervised Pre-training Framework Using Unpaired Speech and Text
Xianghu Yue, Junyi Ao, Xiaoxue Gao +1
USEV: Universal Speaker Extraction with Visual Cue
Zexu Pan, Meng Ge, Haizhou Li
Self-Transriber: Few-shot Lyrics Transcription with Self-training
Xiaoxue Gao, Xianghu Yue, Haizhou Li
A Focused Study on Sequence Length for Dialogue Summarization
Bin Wang, Chen Zhang, Chengwei Wei +1
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
Rui Liu, Shuwei He, Yifan Hu +1
Multi-Tones' Phase Coding (MTPC) of Interaural Time Difference by Spiking Neural Network
Zihan Pan, Malu Zhang, Jibin Wu +1
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
Yuhao Du, Qianwei Huang, Guo Zhu +9
Incorporating External Knowledge and Goal Guidance for LLM-based Conversational Recommender Systems
Chuang Li, Yang Deng, Hengchang Hu +2
Selective HuBERT: Self-Supervised Pre-Training for Target Speaker in Clean and Mixture Speech
Jingru Lin, Meng Ge, Wupeng Wang +2
HLT-NUS Submission for NIST 2019 Multimedia Speaker Recognition Evaluation
Rohan Kumar Das, Ruijie Tao, Jichen Yang +3
SLoClas: A Database for Joint Sound Localization and Classification
Xinyuan Qian, Bidisha Sharma, Amine El Abridi +1
LitE-SNN: Designing Lightweight and Efficient Spiking Neural Network through Spatial-Temporal Compressive Network Search and Joint Optimization
Qianhui Liu, Jiaqi Yan, Malu Zhang +2
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
Rui Liu, Hongyu Yuan, Haizhou Li
Knowledge Distillation from BERT Transformer to Speech Transformer for Intent Classification
Yidi Jiang, Bidisha Sharma, Maulik Madhavi +1
Noise-robust voice conversion with domain adversarial training
Hongqiang Du, Lei Xie, Haizhou Li
Audio-visual Speaker Recognition with a Cross-modal Discriminative Network
Ruijie Tao, Rohan Kumar Das, Haizhou Li
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
Duo Ma, Xianghu Yue, Junyi Ao +2
PIAVE: A Pose-Invariant Audio-Visual Speaker Extraction Network
Qinghua Liu, Meng Ge, Zhizheng Wu +1
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
Hexin Liu, Haoyang Zhang, Qiquan Zhang +4
Accented Text-to-Speech Synthesis with Limited Data
Xuehao Zhou, Mingyang Zhang, Yi Zhou +2
Black-box Attacks on Automatic Speaker Verification using Feedback-controlled Voice Conversion
Xiaohai Tian, Rohan Kumar Das, Haizhou Li
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
Yicheng Gu, Xueyao Zhang, Liumeng Xue +2
EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models
Li Zhou, Lutong Yu, You Lyu +6
Expressive Voice Conversion: A Joint Framework for Speaker Identity and Emotional Style Transfer
Zongyang Du, Berrak Sisman, Kun Zhou +1
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
Shuai Wang, Zhengyang Chen, Kong Aik Lee +2
GrammarGPT: Exploring Open-Source LLMs for Native Chinese Grammatical Error Correction with Supervised Fine-Tuning
Yaxin Fan, Feng Jiang, Peifeng Li +1
USED: Universal Speaker Extraction and Diarization
Junyi Ao, Mehmet Sinan Yıldırım, Ruijie Tao +4
Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks
Zhenzong Wu, Rohan Kumar Das, Jichen Yang +1
Emotional Voice Conversion: Theory, Databases and ESD
Kun Zhou, Berrak Sisman, Rui Liu +1
DynaEval: Unifying Turn and Dialogue Level Evaluation
Chen Zhang, Yiming Chen, Luis Fernando D'Haro +4
The FFSVC 2020 Evaluation Plan
Xiaoyi Qin, Ming Li, Hui Bu +4
Multi-Level Speaker Representation for Target Speaker Extraction
Ke Zhang, Junjie Li, Shuai Wang +4