Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models
Junjie Li, Ziao Wang, Jianghong Ma +1
Large vision-language models (VLMs) achieve strong benchmark performance, but controlling their behavior through instruction tuning remains difficult. Reducing the budget of instru…
cs.CV2025
GiVE: Guiding Visual Encoder to Perceive Overlooked Information
Junjie Li, Jianghong Ma, Xiaofeng Zhang +2
Multimodal Large Language Models have advanced AI in applications like text-to-video generation and visual question answering. These models rely on visual encoders to convert non-t…