1 paper · 1 filter
Chengyin Hu, Jiaju Han, Xuemeng Sun +6
Vision-language models (VLMs) share visual-textual representations across zero-shot classification, image captioning, and visual question answering (VQA), creating a pathway throug…