1 paper · 1 filter
Bohan Deng, Shuo Ye, Zitong Yu
Audio-visual cross-modal Fine-Grained Visual Categorization (FGVC) aims to identify fine-grained categories by jointly leveraging visual and auditory information. However, FGVC und…