activity
20242026
collaborators
Showing cs.SDShow all

5 papers · 1 filter

cs.SD2026

TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation

Shengkui Zhao, Zexu Pan, Haoxu Wang +3

Transformers with global attention capture long-range dependencies but can miss the fine-grained local continuity crucial for speech separation. We propose TF-MossFormer, a time-fr…

cs.SD2025

ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment

Shengkui Zhao, Zexu Pan, Bin Ma

This paper introduces ClearerVoice-Studio, an open-source, AI-powered speech processing toolkit designed to bridge cutting-edge research and practical application. Unlike broad pla…

cs.SD2025

InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation

Chong Zhang, Yukun Ma, Qian Chen +12

We introduce InspireMusic, a framework integrated super resolution and large language model for high-fidelity long-form music generation. A unified framework generates high-fidelit…

cs.SD2025

Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning

Shengkui Zhao, Zexu Pan, Kun Zhou +3

Recently, the application of diffusion probabilistic models has advanced speech enhancement through generative approaches. However, existing diffusion-based methods have focused on…

cs.SD2025

HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution

Shengkui Zhao, Kun Zhou, Zexu Pan +3

The application of generative adversarial networks (GANs) has recently advanced speech super-resolution (SR) based on intermediate representations like mel-spectrograms. However, e…