1 paper
Yang Bai, Yang Zhou, Jun Zhou +3
Large vision language models (VLMs) combine large language models with vision encoders, demonstrating promise across various tasks. However, they often underperform in task-specifi…