1 paper
Yuke Hu, Zheng Li, Zhihao Liu +4
Vision-Language Models (VLMs), built on pre-trained vision encoders and large language models (LLMs), have shown exceptional multi-modal understanding and dialog capabilities, posi…