1 paper · 1 filter
Suhyeong Park, Junha Jung, Jungwoo Park +1
Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expe…