1 paper
Ziwei Cheng, Zhenhua Tan, Zhuomin Zhu
Audio-visual speech recognition (AVSR) relies on effective fusion of audio and visual modalities, yet existing approaches treat cross-modal interaction as a single-step operation w…