1 citations · 1 across the 5 of their papers we have counts for
Showing cs.SDShow all
3 papers · 1 filter
cs.SD2024
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
Li Zhang, Ning Jiang, Qing Wang +3
Trained on 680,000 hours of massive speech data, Whisper is a multitasking, multilingual speech foundation model demonstrating superior performance in automatic speech recognition,…
cs.SD2024
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
Runduo Han, Xiaopeng Yan, Weiming Xu +6
This paper describes our audio-quality-based multi-strategy approach for the audio-visual target speaker extraction (AVTSE) task in the Multi-modal Information based Speech Process…
cs.SD2023
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
Kun Wei, Bei Li, Hang Lv +3
Automatic Speech Recognition (ASR) in conversational settings presents unique challenges, including extracting relevant contextual information from previous conversational turns. D…