2 papers
cs.CV2026
LAS-CLIP: A Lightweight Adapter Steering Approach for CLIP's Visual Encoder
Anh-Khoa Dinh-Duc, Duc-Tai Dinh, Tam V. Nguyen +1
CLIP's visual encoder produces only global image representations, limiting its use in region-level tasks. Existing adaptations rely on visual prompting, input masking, or encoder f…
cs.CL2025
ZSE-Cap: A Zero-Shot Ensemble for Image Retrieval and Prompt-Guided Captioning
Duc-Tai Dinh, Duc Anh Khoa Dinh
We present ZSE-Cap (Zero-Shot Ensemble for Captioning), our 4th place system in Event-Enriched Image Analysis (EVENTA) shared task on article-grounded image retrieval and captionin…