1 paper · 1 filter
Daulet Toibazar, Kesen Wang, Sherif Mohamed +3
Vision-language models (VLMs) extend the conventional large language models by integrating visual data, enabling richer multimodal reasoning and significantly broadens the practica…