1 paper
Ian Palmer, Andrew Rouditchenko, Andrei Barbu +2
Visually-grounded spoken language datasets can enable models to learn cross-modal correspondences with very weak supervision. However, modern audio-visual datasets contain biases t…