1 paper
Peter Robicheaux, Matvei Popov, Anish Madan +4
Vision-language models (VLMs) trained on internet-scale data achieve remarkable zero-shot detection performance on common objects like car, truck, and pedestrian. However, state-of…