1 paper
Fengjie Lu, Chenang Jiang, Jiarui Hai +2
Recent advances in language--audio retrieval have been largely driven by contrastive dual-encoder architectures that align audio and text in a shared embedding space. While effecti…