3 papers
cs.SD2026
MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models
Yize Li, Ningyuan Yang, Sile Yin +6
Large audio-language models (LALMs) have shown promising progress in understanding speech, music, and general sound events, yet their ability to reason about how audio signals are…
eess.AS2025
Real-Time System for Audio-Visual Target Speech Enhancement
T. Aleksandra Ma, Sile Yin, Li-Chia Yang +1
We present a live demonstration for RAVEN, a real-time audio-visual speech enhancement system designed to run entirely on a CPU. In single-channel, audio-only settings, speech enha…
eess.AS2025
Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations
T. Aleksandra Ma, Sile Yin, Li-Chia Yang +1
Speech enhancement in audio-only settings remains challenging, particularly in the presence of interfering speakers. This paper presents a simple yet effective real-time audio-visu…