1 paper · 1 filter
Yuechen Jiang, Enze Zhang, Md Mohsinul Kabir +4
Recent advances in vision-language models (VLMs) have improved image captioning for cultural heritage. However, inferring structured cultural metadata (e.g., creator, origin, perio…