Showing cs.CVShow all
2 papers · 1 filter
cs.CV2024
Multi-Modal interpretable automatic video captioning
Antoine Hanna-Asaad, Decky Aspandi, Titus Zaharia
Video captioning aims to describe video contents using natural language format that involves understanding and interpreting scenes, actions and events that occurs simultaneously on…
cs.CV2024
Deep self-supervised learning with visualisation for automatic gesture recognition
Fabien Allemand, Alessio Mazzela, Jun Villette +2
Gesture is an important mean of non-verbal communication, with visual modality allows human to convey information during interaction, facilitating peoples and human-machine interac…