1 paper
Siyuan Fu, Xuchen Guo, Mingjun Liu +7
The dominant paradigm for Audio-Text Retrieval (ATR) relies on dual-encoder architectures optimized via mini-batch contrastive learning. However, restricting optimization to local…