1 paper
Younggun Kim, Taeheon Kim, Youngseo Kim +1
Existing construction-site Vision-Language Model (VLM) studies have primarily adapted pretrained VLMs through direct QA-style fine-tuning from a single global image, but we argue t…