2 papers
cs.CV2025
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
Lei Yang, Junshan Jin, Mingyuan Zhang +3
Visual speech recognition is a technique to identify spoken content in silent speech videos, which has raised significant attention in recent years. Advancements in data-driven dee…
cs.CV2025
Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
Yi He, Lei Yang, Shilin Wang
This paper introduces a novel approach to Visual Forced Alignment (VFA), aiming to accurately synchronize utterances with corresponding lip movements, without relying on audio cues…