1 paper · 1 filter
Aristeidis Papadopoulos, Rishabh Jain, Naomi Harte
Audio-Visual Speech Recognition (AVSR) systems nowadays integrate Large Language Model (LLM) decoders with transformer-based encoders, achieving state-of-the-art results. However,…