1 paper
Ching-Feng Yeh, Po-Yao Huang, Vasu Sharma +2
We propose Fast Language-Audio Pre-training (FLAP), a self-supervised approach that efficiently and effectively learns aligned audio and language representations through masking, c…