1 paper · 1 filter
Victor Carbune, Hassan Mansoor, Fangyu Liu +4
Vision-language models (VLMs) are achieving increasingly strong performance on multimodal tasks. However, reasoning capabilities remain limited particularly for smaller VLMs, while…