5 papers · 1 filter
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
Qian-Wei Wang, Guanghao Meng, Ren Cai +2
Large-scale vision-language models (VLMs) such as CLIP exhibit strong zero-shot generalization, but adapting them to downstream tasks typically requires costly labeled data. Existi…
Heterogeneous Uncertainty-Guided Composed Image Retrieval with Fine-Grained Probabilistic Learning
Haomiao Tang, Jinpeng Wang, Minyi Zhao +4
Composed Image Retrieval (CIR) enables image search by combining a reference image with modification text. Intrinsic noise in CIR triplets incurs intrinsic uncertainty and threaten…
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
GuangHao Meng, Sunan He, Jinpeng Wang +7
Vision-language retrieval (VLR) has attracted significant attention in both academia and industry, which involves using text (or images) as queries to retrieve corresponding images…
One-stage Low-resolution Text Recognition with High-resolution Knowledge Transfer
Hang Guo, Tao Dai, Mingyan Zhu +4
Recognizing characters from low-resolution (LR) text images poses a significant challenge due to the information deficiency as well as the noise and blur in low-quality images. Cur…
Towards Robust Scene Text Image Super-resolution via Explicit Location Enhancement
Hang Guo, Tao Dai, Guanghao Meng +1
Scene text image super-resolution (STISR), aiming to improve image quality while boosting downstream scene text recognition accuracy, has recently achieved great success. However,…