1 paper · 1 filter
Yang Bai, Yang Zhou, Jun Zhou +3
Large vision language models (VLMs) combine large language models with vision encoders, demonstrating promise across various tasks. However, they often underperform in task-specifi…