2 papers
cs.CV2026
VALLR: Visual ASR Language Model for Lip Reading
Marshall Thomas, Edward Fish, Richard Bowden
Lip Reading, or Visual Automatic Speech Recognition (V-ASR), is a complex task requiring the interpretation of spoken language exclusively from visual cues, primarily lip movements…
cs.CL2025
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
Marshall Thomas, Edward Fish, Richard Bowden
Despite progress in gloss-free Sign Language Translation (SLT), traditional single modality end-to-end approaches consistently fail on two critical components of natural signing: t…