collaborators

14 papers

eess.AS2026

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

Yishun Li, Yang Xiao, Gongping Huang +3

Training automatic speech recognition (ASR) models for low-resource languages is challenging due to limited data and highly variable supervision quality. In particular, Pacific Ind…

cs.SD2026

A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification

Beile Ning, Jiayi Yu, Zitong Wang +5

This technical report describes our system for Task 1 of the DCASE 2026 Challenge, which aims to classify heterogeneous audio recordings according to the Broad Sound Taxonomy (BST)…

cs.LG2026

Localizing and Editing Knowledge in Large Audio-Language Models

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu +3

Large Audio-Language Models (LALMs) have shown strong performance in speech understanding, making speech a natural interface for accessing factual information. Yet they are trained…

eess.AS2026

Activation Steering for Accent Adaptation in Large Audio Language Models

Jinuo Sun, Yang Xiao, Sung Kyun Chung +4

Accent variability remains a major source of errors in automatic speech recognition, yet most adaptation methods rely on parameter fine-tuning without understanding where accent in…

cs.SD2026

CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering

Siyi Wang, Shihong Tan, Siyi Liu +4

Emotional expression in human speech is nuanced and compositional, often involving multiple, sometimes conflicting, affective cues that may diverge from linguistic content. In cont…

cs.SD2026

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

Hongyu Jin, Siyi Wang, Yang Xiao +10

Humans process rich auditory environments through tightly integrated cognitive capabilities such as audio perception, audio reasoning, and memory. Despite recent progress in large…