1 paper
Xiwen Chen, Yen-Chieh Lien, Susan Liu +4
The rapid growth of e-commerce requires robust multimodal representations that capture diverse signals from user-generated listings. Existing vision-language models (VLMs) typicall…