1 paper
Junhao Xiao, Shun Feng, Zhiyu Wu +6
Audio-Visual Speaker Detection (AVSD) hinges on modeling both individual temporal continuity and inter-personal social context. Existing coupled architectures struggle to reconcile…