1 paper · 1 filter
Anh-Khoa Dinh-Duc, Duc-Tai Dinh, Tam V. Nguyen +1
CLIP's visual encoder produces only global image representations, limiting its use in region-level tasks. Existing adaptations rely on visual prompting, input masking, or encoder f…