1 paper
Pavana Pradeep, Krishna Kant, Suya Yu
Vision-Language Models (VLMs) offer the ability to generate high-level, interpretable descriptions of complex activities from images and videos, making them valuable for situationa…