2 papers
eess.AS2023
Training Audio Captioning Models without Audio
Soham Deshmukh, Benjamin Elizalde, Dimitra Emmanouilidou +3
Automated Audio Captioning (AAC) is the task of generating natural language descriptions given an audio stream. A typical AAC system requires manually curated training data of audi…
eess.AS2023
Real-Time Audio-Visual End-to-End Speech Enhancement
Zirun Zhu, Hemin Yang, Min Tang +3
Audio-visual speech enhancement (AV-SE) methods utilize auxiliary visual cues to enhance speakers' voices. Therefore, technically they should be able to outperform the audio-only s…