collaborators

19 papers

cs.CL2026

Easper: An Accessible ASR Pipeline for Language Documentation

Aso Mahmudi, Ting Dang, Ekaterina Vylomova +1

Audio transcription is a critical bottleneck in language documentation. While multilingual Automatic Speech Recognition (ASR) models like Whisper offer solutions, field linguists o…

cs.SD2026

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

Yanqiu Li, Yang Xiao, Jisheng Bai +3

Recent advances in speech synthesis and audio generation have made high-fidelity acoustic forgery low-cost and difficult to attribute, enabling a realistic attack scenario in which…

eess.AS2026

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

Yishun Li, Yang Xiao, Gongping Huang +3

Training automatic speech recognition (ASR) models for low-resource languages is challenging due to limited data and highly variable supervision quality. In particular, Pacific Ind…

cs.SD2026

Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge

Xueping Zhang, Han Yin, Yang Xiao +4

The Environment-Aware Speech and Sound Deepfake Detection Challenge (ESDD2), held in conjunction with ICME 2026, evaluated systems for five component-level audio spoofing detection…

cs.SD2026

Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

Han Yin, Yang Xiao, Younghoo Kwon +2

Large audio language models (LALMs) are a class of foundation models for audio understanding. Existing LALMs tend to degrade significantly in real-world noisy acoustic conditions w…

eess.AS2026

Continual Adaptation for Pacific Indigenous Speech Recognition

Yang Xiao, Aso Mahmudi, Nick Thieberger +3

Speech foundation models struggle with low-resource Pacific Indigenous languages because of severe data scarcity. Furthermore, full fine-tuning risks catastrophic forgetting. To ad…