8 papers
Positive-Incentive Noise Predictor for Adversarial Purification in Speaker Verification
Yibo Bai, Sizhou Chen, Michele Panariello +5
Modern automatic speaker verification (ASV) systems are vulnerable to adversarial perturbations. Diffusion-based purification has recently shown strong effectiveness against such p…
High-Fidelity Generative Audio Compression at 0.275kbps
Hao Ma, Ruihao Jing, Shansong Liu +4
High-fidelity general audio compression at ultra-low bitrates is crucial for applications ranging from low-bandwidth communication to generative audio-language modeling. Traditiona…
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
Ruihao Jing, Cheng Gong, Yu Jiang +5
Rare words remain a critical bottleneck for speech-to-text systems. While direct fine-tuning improves recognition of target words, it often incurs high cost, catastrophic forgettin…
Towards Multimodal Query-Based Spatial Audio Source Extraction
Chenxin Yu, Hao Ma, Xu Li +4
Query-based audio source extraction seeks to recover a target source from a mixture conditioned on a query. Existing approaches are largely confined to single-channel audio, leavin…
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
Lei Zhao, Rujin Chen, Chi Zhang +2
Recently, with the advancement of AIGC, deep learning-based video-to-audio (V2A) technology has garnered significant attention. However, existing research mostly focuses on mono au…
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
Lei Zhao, Sizhou Chen, Linfeng Feng +4
Text-to-audio (TTA), which generates audio signals from textual descriptions, has received huge attention in recent years. However, recent works focused on text to monaural audio o…