Showing cs.CVShow all
3 papers · 1 filter
cs.CV2025
Positional Bias in Multimodal Embedding Models: Do They Favor the Beginning, the Middle, or the End?
Kebin Wu, Fatima Albreiki
Positional bias - where models overemphasize certain positions regardless of content - has been shown to negatively impact model performance across various tasks. While recent rese…
cs.CV2025
FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs
Mothilal Asokan, Kebin Wu, Fatima Albreiki
As a pioneering vision-language model, CLIP (Contrastive Language-Image Pre-training) has achieved significant success across various domains and a wide range of downstream vision-…
cs.CV2024
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
Ameera Bawazir, Kebin Wu, Wenbin Li
Recent advancements in vision-language pre-training via contrastive learning have significantly improved performance across computer vision tasks. However, in the medical domain, o…