Showing eess.ASShow all
2 papers · 1 filter
eess.AS2025
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
Xuehao Zhou, Mingyang Zhang, Yi Zhou +2
Generating speech across different accents while preserving speaker identity is crucial for various real-world applications. However, accurately and independently modeling both spe…
eess.AS2024
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
Xianghu Yue, Xiaohai Tian, Lu Lu +3
There has been a long-standing quest for a unified audio-visual-text model to enable various multimodal understanding tasks, which mimics the listening, seeing and reading process…