1 paper
Jan Erik van Woerden, Gertjan Burghouts, Lotte Nijskens +4
Vision-language models (VLMs) like CLIP enable zero-shot classification by aligning images and text in a shared embedding space, offering advantages for defense applications with s…