1 paper · 2 filters
Matan Rusanovsky, Shimon Malnick, Shai Avidan
Vision-language models have achieved remarkable success in cross-modal understanding. Yet, these models remain limited to object-level or region-level grounding, lacking the capabi…