1 paper
Hoin Jung, Taeuk Jang, Xiaoqian Wang
Recent advancements in Vision-Language Models (VLMs) have enabled complex multimodal tasks by processing text and image data simultaneously, significantly enhancing the field of ar…