2 papers
cs.CL2024
Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language Model
Keito Sasagawa, Koki Maeda, Issa Sugiura +3
To develop high-performing Visual Language Models (VLMs), it is essential to prepare multimodal resources, such as image-text pairs, interleaved data, and instruction data. While m…
cs.CV2024
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
Koki Maeda, Shuhei Kurita, Taiki Miyanishi +1
Given the accelerating progress of vision and language modeling, accurate evaluation of machine-generated image captions remains critical. In order to evaluate captions more closel…