1 paper · 1 filter
Sinyoung Ra, Jonghun Kim, Hyunjin Park
Recent advances in large language models (LLMs) and their extension to vision-language models (VLMs) have made it easier to combine text and images for tasks such as report generat…