9 papers · 1 filter
QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition
Yishun Li, Yang Xiao, Gongping Huang +3
Training automatic speech recognition (ASR) models for low-resource languages is challenging due to limited data and highly variable supervision quality. In particular, Pacific Ind…
Continual Adaptation for Pacific Indigenous Speech Recognition
Yang Xiao, Aso Mahmudi, Nick Thieberger +3
Speech foundation models struggle with low-resource Pacific Indigenous languages because of severe data scarcity. Furthermore, full fine-tuning risks catastrophic forgetting. To ad…
ImKWS: Test-Time Adaptation for Keyword Spotting with Class Imbalance
Hanyu Ding, Yang Xiao, Jiaheng Dong +1
Keyword spotting (KWS) identifies words for voice assistants, but environmental noise frequently reduces accuracy. Standard adaptation fixes this issue and strictly requires origin…
Activation Steering for Accent Adaptation in Large Audio Language Models
Jinuo Sun, Yang Xiao, Sung Kyun Chung +4
Accent variability remains a major source of errors in automatic speech recognition, yet most adaptation methods rely on parameter fine-tuning without understanding where accent in…
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
Yuanjian Chen, Yang Xiao, Han Yin +3
Large Audio Language Models (LALMs) are increasingly capable of reasoning over audio, yet existing benchmarks offer limited coverage of reasoning in polyphonic audio, where multipl…
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
Yang Xiao, Siyi Wang, Eun-Jung Holden +1
Speech and audio systems operate in inherently non-stationary environments, yet continual learning (CL) research in this domain, especially in the foundation model era, remains fra…