NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (342)

cs.SD2021

Multi-Level Transfer Learning from Near-Field to Far-Field Speaker Verification

Li Zhang, Qing Wang, Kong Aik Lee +2

cs.CL2024

FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency

Rui Liu, Jiatian Xi, Ziyue Jiang +1

cs.CL2019

End-to-End Code-Switching ASR for Low-Resourced Language Pairs

Xianghu Yue, Grandee Lee, Emre Yılmaz +2

cs.CL2026

Bridging What the Model Thinks and How It Speaks: Expressive Speech Generation via Self-Aware Intent-Realization Alignment

Kuang Wang, Lai Wei, Ping Lin +8

cs.SD2024

Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy

Wenxuan Wu, Xueyuan Chen, Xixin Wu +2

eess.AS2020

Multi-Encoder-Decoder Transformer for Code-Switching Speech Recognition

Xinyuan Zhou, Emre Yılmaz, Yanhua Long +2

cs.CV2022

Ego4D: Around the World in 3,000 Hours of Egocentric Video

Kristen Grauman, Andrew Westbury, Eugene Byrne +82

cs.CL2024

Roadmap towards Superhuman Speech Understanding using Large Language Models

Fan Bu, Yuhao Zhang, Xidong Wang +3

eess.AS2020

The Attacker's Perspective on Automatic Speaker Verification: An Overview

Rohan Kumar Das, Xiaohai Tian, Tomi Kinnunen +1

cs.CL2026

RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems

Jingru Lin, Chen Zhang, Stephen Y. Liu +1

cs.CL2024

CrossTune: Black-Box Few-Shot Classification with Label Enhancement

Danqing Luo, Chen Zhang, Yan Zhang +1

cs.CL2023

HuatuoGPT, towards Taming Language Model to Be a Doctor

Hongbo Zhang, Junying Chen, Feng Jiang +10

eess.AS2023

NeuroHeed: Neuro-Steered Speaker Extraction using EEG Signals

Zexu Pan, Marvin Borsdorf, Siqi Cai +2

cs.CV2025

Quantized Spike-driven Transformer

Xuerui Qiu, Malu Zhang, Jieyuan Zhang +7

eess.AS2023

PoLyScriber: Integrated Fine-tuning of Extractor and Lyrics Transcriber for Polyphonic Music

Xiaoxue Gao, Chitralekha Gupta, Haizhou Li

cs.CV2025

S$^2$NN: Sub-bit Spiking Neural Networks

Wenjie Wei, Malu Zhang, Jieyuan Zhang +8

eess.AS2025

Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context

Junyi Ao, Dekun Chen, Xiaohai Tian +6

cs.LG2018

A Cost-Sensitive Deep Belief Network for Imbalanced Classification

Chong Zhang, Kay Chen Tan, Haizhou Li +1

eess.AS2024

RefXVC: Cross-Lingual Voice Conversion with Enhanced Reference Leveraging

Mingyang Zhang, Yi Zhou, Yi Ren +3

eess.AS2021

Transfer Learning from Speech Synthesis to Voice Conversion with Non-Parallel Training Data

Mingyang Zhang, Yi Zhou, Li Zhao +1

cs.SD2023

Ripple sparse self-attention for monaural speech enhancement

Qiquan Zhang, Hongxu Zhu, Qi Song +3

cs.CL2026

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

Siyuan Liu, Jiahui Xu, Feng Jiang +6

eess.AS2024

Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement

Jie Zhang, Qing-Tian Xu, Zhen-Hua Ling +1

cs.SD2023

Betray Oneself: A Novel Audio DeepFake Detection Model via Mono-to-Stereo Conversion

Rui Liu, Jinhua Zhang, Guanglai Gao +1

eess.AS2021

HLT-NUS SUBMISSION FOR 2020 NIST Conversational Telephone Speech SRE

Rohan Kumar Das, Ruijie Tao, Haizhou Li

eess.AS2026

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

Li Zhou, Hao Jiang, Junjie Li +2

eess.AS2019

Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet

Mingyang Zhang, Xin Wang, Fuming Fang +2

cs.NE2020

Rectified Linear Postsynaptic Potential Function for Backpropagation in Deep Spiking Neural Networks

Malu Zhang, Jiadong Wang, Burin Amornpaisannon +8

eess.AS2025

Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data

Qibing Bai, Sho Inoue, Shuai Wang +3

cs.CL2024

Quantifying Self-diagnostic Atomic Knowledge in Chinese Medical Foundation Model: A Computational Analysis

Yaxin Fan, Feng Jiang, Benyou Wang +2

eess.AS2023

Mixed-EVC: Mixed Emotion Synthesis and Control in Voice Conversion

Kun Zhou, Berrak Sisman, Carlos Busso +2

cs.SD2026

MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions

Junjie Li, Wenxuan Wu, Shuai Wang +4

cs.CL2022

PoE: a Panel of Experts for Generalized Automatic Dialogue Assessment

Chen Zhang, Luis Fernando D'Haro, Qiquan Zhang +2

cs.CV2025

Binary Event-Driven Spiking Transformer

Honglin Cao, Zijian Zhou, Wenjie Wei +6

cs.CL2019

Large-Scale Speaker Diarization of Radio Broadcast Archives

Emre Yılmaz, Adem Derinel, Zhou Kun +4

cs.LG2025

Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation

Simin Chen, Yiming Chen, Zexin Li +8

cs.SD2024

Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models

Yiming Chen, Xianghu Yue, Xiaoxue Gao +4

cs.CL2026

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

Zhenyu Liu, Xuanyu Zhang, Yunxin Li +10

The paper identifies gradient conflicts between acoustic and semantic modeling as the cause of modality interference in full-duplex spoken language models and proposes Lychee-FD, a…

#full-duplex spoken language models#modality interference#hierarchical parameter separation#semantic alignment
cs.CL2019

Code-Switching Detection Using ASR-Generated Language Posteriors

Qinyi Wang, Emre Yılmaz, Adem Derinel +1

cs.CL2023

How Well Do Text Embedding Models Understand Syntax?

Yan Zhang, Zhaopeng Feng, Zhiyang Teng +2

cs.SD2022

Emotion Intensity and its Control for Emotional Voice Conversion

Kun Zhou, Berrak Sisman, Rajib Rana +2

cs.SD2026

Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech

Yihang Lin, Li Zhou, Congwei Cao +4

cs.SD2024

Amphion: An Open-Source Audio, Music and Speech Generation Toolkit

Xueyao Zhang, Liumeng Xue, Yicheng Gu +16

eess.AS2023

The NUS-HLT System for ICASSP2024 ICMC-ASR Grand Challenge

Meng Ge, Yizhou Peng, Yidi Jiang +6

eess.AS2025

Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis

Xuehao Zhou, Mingyang Zhang, Yi Zhou +2

eess.AS2026

CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data

Qibing Bai, Shuhao Shi, Shuai Wang +3

eess.AS2019

Automatic Lyrics Alignment and Transcription in Polyphonic Music: Does Background Music Help?

Chitralekha Gupta, Emre Yılmaz, Haizhou Li

cs.SD2025

ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction

Wenxuan Wu, Shuai Wang, Xixin Wu +2

cs.CL2024

DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language Models

Jiabao Pan, Yan Zhang, Chen Zhang +3

cs.CL2016

Fantastic 4 system for NIST 2015 Language Recognition Evaluation

Kong Aik Lee, Ville Hautamäki, Anthony Larcher +14

eess.AS2025

Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention

Ruijie Tao, Xinyuan Qian, Yidi Jiang +3

cs.NE2019

Deep Spiking Neural Networks for Large Vocabulary Automatic Speech Recognition

Jibin Wu, Emre Yilmaz, Malu Zhang +2

cs.CL2025

Aligning Language Models Using Follow-up Likelihood as Reward Signal

Chen Zhang, Dading Chong, Feng Jiang +4

eess.AS2023

EEG-Derived Voice Signature for Attended Speaker Detection

Hongxu Zhu, Siqi Cai, Yidi Jiang +2

eess.AS2025

Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset

Rui Liu, Pu Gao, Jiatian Xi +3

cs.RO2025

Human Demonstrations are Generalizable Knowledge for Robots

Te Cui, Tianxing Zhou, Zicai Peng +6

cs.SD2022

Genre-conditioned Acoustic Models for Automatic Lyrics Transcription of Polyphonic Music

Xiaoxue Gao, Chitralekha Gupta, Haizhou Li

eess.SP2018

A Multi-State Diagnosis and Prognosis Framework with Feature Learning for Tool Condition Monitoring

Chong Zhang, Geok Soon Hong, Jun-Hong Zhou +5

cs.CL2024

Advancing Topic Segmentation and Outline Generation in Chinese Texts: The Paragraph-level Topic Representation, Corpus, and Benchmark

Feng Jiang, Weihao Liu, Xiaomin Chu +3

cs.CL2025

NE-PADD: Leveraging Named Entity Knowledge for Robust Partial Audio Deepfake Detection via Attention Aggregation

Huhong Xian, Rui Liu, Berrak Sisman +1

cs.SD2025

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues

Junjie Li, Ke Zhang, Shuai Wang +3

eess.AS2021

Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals

Meng Ge, Chenglin Xu, Longbiao Wang +3

cs.SD2022

Time-Frequency Attention for Monaural Speech Enhancement

Qiquan Zhang, Qi Song, Zhaoheng Ni +2

cs.SD2021

Serialized Multi-Layer Multi-Head Attention for Neural Speaker Embedding

Hongning Zhu, Kong Aik Lee, Haizhou Li

cs.HC2025

A Robust Multi-Scale Framework with Test-Time Adaptation for sEEG-Based Speech Decoding

Suli Wang, Yang-yang Li, Siqi Cai +1

cs.SD2024

sVAD: A Robust, Low-Power, and Light-Weight Voice Activity Detection with Spiking Neural Networks

Qu Yang, Qianhui Liu, Nan Li +3

eess.AS2022

Music-robust Automatic Lyrics Transcription of Polyphonic Music

Xiaoxue Gao, Chitralekha Gupta, Haizhou Li

cs.SD2022

MFA: TDNN with Multi-scale Frequency-channel Attention for Text-independent Speaker Verification with Short Utterances

Tianchi Liu, Rohan Kumar Das, Kong Aik Lee +1

cs.CL2022

token2vec: A Joint Self-Supervised Pre-training Framework Using Unpaired Speech and Text

Xianghu Yue, Junyi Ao, Xiaoxue Gao +1

eess.AS2022

USEV: Universal Speaker Extraction with Visual Cue

Zexu Pan, Meng Ge, Haizhou Li

eess.AS2023

Self-Transriber: Few-shot Lyrics Transcription with Self-training

Xiaoxue Gao, Xianghu Yue, Haizhou Li

cs.CL2022

A Focused Study on Sequence Length for Dialogue Summarization

Bin Wang, Chen Zhang, Chengwei Wei +1

cs.CV2025

Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech

Rui Liu, Shuwei He, Yifan Hu +1

eess.AS2020

Multi-Tones' Phase Coding (MTPC) of Interaural Time Difference by Spiking Neural Network

Zihan Pan, Malu Zhang, Jibin Wu +1

cs.CL2025

MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols

Yuhao Du, Qianwei Huang, Guo Zhu +9

cs.CL2024

Incorporating External Knowledge and Goal Guidance for LLM-based Conversational Recommender Systems

Chuang Li, Yang Deng, Hengchang Hu +2

eess.AS2023

Selective HuBERT: Self-Supervised Pre-Training for Target Speaker in Clean and Mixture Speech

Jingru Lin, Meng Ge, Wupeng Wang +2

eess.AS2020

HLT-NUS Submission for NIST 2019 Multimedia Speaker Recognition Evaluation

Rohan Kumar Das, Ruijie Tao, Jichen Yang +3

cs.SD2021

SLoClas: A Database for Joint Sound Localization and Classification

Xinyuan Qian, Bidisha Sharma, Amine El Abridi +1

cs.NE2024

LitE-SNN: Designing Lightweight and Efficient Spiking Neural Network through Spatial-Temporal Compressive Network Search and Joint Optimization

Qianhui Liu, Jiaqi Yan, Malu Zhang +2

cs.MM2025

Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition

Rui Liu, Hongyu Yuan, Haizhou Li

cs.CL2021

Knowledge Distillation from BERT Transformer to Speech Transformer for Intent Classification

Yidi Jiang, Bidisha Sharma, Maulik Madhavi +1

cs.SD2022

Noise-robust voice conversion with domain adversarial training

Hongqiang Du, Lei Xie, Haizhou Li

eess.AS2020

Audio-visual Speaker Recognition with a Cross-modal Discriminative Network

Ruijie Tao, Rohan Kumar Das, Haizhou Li

eess.AS2024

Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks

Duo Ma, Xianghu Yue, Junyi Ao +2

cs.SD2023

PIAVE: A Pose-Invariant Audio-Visual Speaker Extraction Network

Qinghua Liu, Meng Ge, Zhizheng Wu +1

eess.AS2026

Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives

Hexin Liu, Haoyang Zhang, Qiquan Zhang +4

eess.AS2023

Accented Text-to-Speech Synthesis with Limited Data

Xuehao Zhou, Mingyang Zhang, Yi Zhou +2

eess.AS2019

Black-box Attacks on Automatic Speaker Verification using Feedback-controlled Voice Conversion

Xiaohai Tian, Rohan Kumar Das, Haizhou Li

cs.SD2024

An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder

Yicheng Gu, Xueyao Zhang, Liumeng Xue +2

cs.CL2026

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

Li Zhou, Lutong Yu, You Lyu +6

eess.AS2021

Expressive Voice Conversion: A Joint Framework for Speaker Identity and Emotional Style Transfer

Zongyang Du, Berrak Sisman, Kun Zhou +1

eess.AS2024

Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning

Shuai Wang, Zhengyang Chen, Kong Aik Lee +2

cs.CL2023

GrammarGPT: Exploring Open-Source LLMs for Native Chinese Grammatical Error Correction with Supervised Fine-Tuning

Yaxin Fan, Feng Jiang, Peifeng Li +1

cs.SD2025

USED: Universal Speaker Extraction and Diarization

Junyi Ao, Mehmet Sinan Yıldırım, Ruijie Tao +4

eess.AS2020

Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks

Zhenzong Wu, Rohan Kumar Das, Jichen Yang +1

cs.CL2022

Emotional Voice Conversion: Theory, Databases and ESD

Kun Zhou, Berrak Sisman, Rui Liu +1

cs.CL2021

DynaEval: Unifying Turn and Dialogue Level Evaluation

Chen Zhang, Yiming Chen, Luis Fernando D'Haro +4

cs.SD2020

The FFSVC 2020 Evaluation Plan

Xiaoyi Qin, Ming Li, Hui Bu +4

eess.AS2024

Multi-Level Speaker Representation for Target Speaker Extraction

Ke Zhang, Junjie Li, Shuai Wang +4