1 paper
Alessandro Sottovia, Alessandro Torcinovich, Oswald Lanz
Fine-grained action recognition in egocentric video is challenging for Vision-Language Models (VLMs): actions often differ only in small visual cues, and a single model tends to be…