Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
Rui Xu, Yunke Wang, Yong Luo +1
Large Vision-Language Models (LVLMs) encode visual inputs as dense sequences of patch-level tokens to capture fine-grained semantics. These visual tokens often outnumber their text…
cs.CV2025
Marine Saliency Segmenter: Object-Focused Conditional Diffusion with Region-Level Semantic Knowledge Distillation
Laibin Chang, Yunke Wang, JiaXing Huang +3
Marine Saliency Segmentation (MSS) plays a pivotal role in various vision-based marine exploration tasks. However, existing marine segmentation techniques face the dilemma of objec…
cs.CV2025
CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V
Siyu Xu, Yunke Wang, Daochang Liu +2
Recent advancements in generative AI have suggested that by taking visual prompts, GPT-4V can demonstrate significant proficiency in visual recognition tasks. Despite its impressiv…