1 paper
Zheng Liu, Hao Liang, Bozhou Li +5
Vision-Language Models (VLMs) have recently emerged, demonstrating remarkable vision-understanding capabilities. However, training these models requires large-scale datasets, which…