papers

Publications (38)

eess.AS2023

The NUS-HLT System for ICASSP2024 ICMC-ASR Grand Challenge

Meng Ge, Yizhou Peng, Yidi Jiang +6

eess.AS2026

Evaluating the Expressive Appropriateness of Speech in Rich Contexts

Tianrui Wang, Ziyang Ma, Yizhou Peng +26

cs.CL2026

POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation

Xuanchen Li, Chenrui Cui, Tianrui Wang +9

eess.AS2024

Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement

Tingting Wang, Tianrui Wang, Meng Ge +3

eess.AS2023

Locate and Beamform: Two-dimensional Locating All-neural Beamformer for Multi-channel Speech Separation

Yanjie Fu, Meng Ge, Honglong Wang +7

cs.SD2025

USED: Universal Speaker Extraction and Diarization

Junyi Ao, Mehmet Sinan Yıldırım, Ruijie Tao +4

eess.AS2023

A Refining Underlying Information Framework for Monaural Speech Enhancement

Rui Cao, Tianrui Wang, Meng Ge +2

cs.LG2022

RAW-GNN: RAndom Walk Aggregation based Graph Neural Network

Di Jin, Rui Wang, Meng Ge +4

eess.AS2024

An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement

Qiquan Zhang, Meng Ge, Hongxu Zhu +4

eess.AS2025

LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement

Junyu Wang, Zizhen Lin, Tianrui Wang +3

eess.AS2025

Learning Time-Graph Frequency Representation for Monaural Speech Enhancement

Tingting Wang, Tianrui Wang, Meng Ge +2

eess.AS2021

Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals

Meng Ge, Chenglin Xu, Longbiao Wang +3

eess.AS2024

SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech

Jingru Lin, Meng Ge, Junyi Ao +2

eess.AS2020

SpEx+: A Complete Time Domain Speaker Extraction Network

Meng Ge, Chenglin Xu, Longbiao Wang +3

cs.SD2024

sVAD: A Robust, Low-Power, and Light-Weight Voice Activity Detection with Spiking Neural Networks

Qu Yang, Qianhui Liu, Nan Li +3

eess.AS2022

MIMO-DBnet: Multi-channel Input and Multiple Outputs DOA-aware Beamforming Network for Speech Separation

Yanjie Fu, Haoran Yin, Meng Ge +5

eess.AS2024

Progressive Residual Extraction based Pre-training for Speech Representation Learning

Tianrui Wang, Jin Li, Ziyang Ma +8

eess.AS2026

Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning

Tianrui Wang, Meng Ge, Cheng Gong +11

cs.CL2025

Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents

Weiting Tan, Xinghua Qu, Ming Tu +4

cs.SD2026

MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates

Zikang Huang, Meng Ge, Tianrui Wang +4

cs.SD2025

ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning

Junyu Wang, Tianrui Wang, Meng Ge +2

cs.CV2022

VCSE: Time-Domain Visual-Contextual Speaker Extraction Network

Junjie Li, Meng Ge, Zexu Pan +2

eess.AS2022

USEV: Universal Speaker Extraction with Visual Cue

Zexu Pan, Meng Ge, Haizhou Li

eess.AS2022

Iterative Sound Source Localization for Unknown Number of Sources

Yanjie Fu, Meng Ge, Haoran Yin +4

cs.SD2025

Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module

Zhongjian Cui, Chenrui Cui, Tianrui Wang +6

cs.SD2025

Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models

Junyu Wang, Ziyang Ma, Zhengding Luo +4

eess.AS2022

L-SpEx: Localized Target Speaker Extraction

Meng Ge, Chenglin Xu, Longbiao Wang +3

eess.AS2026

Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis

Tianrui Wang, Haoyu Wang, Meng Ge +10

cs.SD2024

Gradient weighting for speaker verification in extremely low Signal-to-Noise Ratio

Yi Ma, Kong Aik Lee, Ville Hautamäki +2

eess.AS2023

Selective HuBERT: Self-Supervised Pre-Training for Target Speaker in Clean and Mixture Speech

Jingru Lin, Meng Ge, Wupeng Wang +2

eess.AS2022

MIMO-DoAnet: Multi-channel Input and Multiple Outputs DoA Network with Unknown Number of Sound Sources

Haoran Yin, Meng Ge, Yanjie Fu +5

cs.SD2023

Rethinking the visual cues in audio-visual speaker extraction

Junjie Li, Meng Ge, Zexu pan +4

cs.SD2025

Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement

Junyu Wang, Zizhen Lin, Tianrui Wang +3

cs.CL2022

Language-specific Characteristic Assistance for Code-switching Speech Recognition

Tongtong Song, Qiang Xu, Meng Ge +5

eess.AS2024

WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction

Shuai Wang, Ke Zhang, Shaoxiong Lin +6

cs.SD2023

PIAVE: A Pose-Invariant Audio-Visual Speaker Extraction Network

Qinghua Liu, Meng Ge, Zhizheng Wu +1

cs.SD2023

Audio-Visual Active Speaker Extraction for Sparsely Overlapped Multi-talker Speech

Junjie Li, Ruijie Tao, Zexu Pan +3

eess.AS2022

A Hybrid Continuity Loss to Reduce Over-Suppression for Time-domain Target Speaker Extraction

Zexu Pan, Meng Ge, Haizhou Li