1 paper
Boyi Li, Ce Zhang, Richard M. Timmerman +1
The emergence of vision language models (VLMs) bridges the gap between vision and language, enabling multimodal understanding beyond traditional visual-only deep learning models. H…