1 paper
Shota Nakada, Taichi Nishimura, Hokuto Munakata +2
Current audio-visual representation learning can capture rough object categories (e.g., ``animals'' and ``instruments''), but it lacks the ability to recognize fine-grained details…