1 paper · 1 filter
Shuoyuan Wang, Jindong Wang, Guoqing Wang +3
Vision-language models (VLMs) have emerged as formidable tools, showing their strong capability in handling various open-vocabulary tasks in image recognition, text-driven visual c…