1 paper
Okan Köpüklü, Maja Taseska, Gerhard Rigoll
Successful active speaker detection requires a three-stage pipeline: (i) audio-visual encoding for all speakers in the clip, (ii) inter-speaker relation modeling between a referenc…