1 paper
Zili Wang, Qi Yang, Linsu Shi +4
Recently, transformer-based models have demonstrated remarkable performance on audio-visual segmentation (AVS) tasks. However, their expensive computational cost makes real-time in…