1 paper · 1 filter
Xinyu Pi, Mingyuan Wu, Jize Jiang +5
Smaller-scale Vision-Langauge Models (VLMs) often claim to perform on par with larger models in general-domain visual grounding and question-answering benchmarks while offering adv…