Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Adapting Vision-Language Models for E-commerce Understanding at Scale
Matteo Nulli, Vladimir Orshulevich, Tala Bazazo +9
E-commerce product understanding demands by nature, strong multimodal comprehension from text, images, and structured attributes. General-purpose Vision-Language Models (VLMs) enab…
cs.CV2024
ITEm: Unsupervised Image-Text Embedding Learning for eCommerce
Baohao Liao, Michael Kozielski, Sanjika Hewavitharana +3
Product embedding serves as a cornerstone for a wide range of applications in eCommerce. The product embedding learned from multiple modalities shows significant improvement over t…