3 papers
cs.CV2025
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
Tao Sun, Oliver Liu, JinJin Li +1
Multimodal generative AI usually involves generating image or text responses given inputs in another modality. The evaluation of image-text relevancy is essential for measuring res…
cs.IR2025
Zero-Shot Retrieval for Scalable Visual Search in a Two-Sided Marketplace
Andre Rusli, Shoma Ishimoto, Sho Akiyama +1
Visual search offers an intuitive way for customers to explore diverse product catalogs, particularly in consumer-to-consumer (C2C) marketplaces where listings are often unstructur…
cs.CV2025
Improved Alignment of Modalities in Large Vision Language Models
Kartik Jangra, Aman Kumar Singh, Yashwani Mann +1
Recent advancements in vision-language models have achieved remarkable results in making language models understand vision inputs. However, a unified approach to align these models…