1 paper
Li Ju, Max Andersson, Stina Fredriksson +4
Vision-language models (VLMs) as foundation models have significantly enhanced performance across a wide range of visual and textual tasks, without requiring large-scale training f…