1 paper · 1 filter
Xingming Long, Yu Liu, Zhiwei Yang +7
Modern vision-language models (VLMs) can directly answer many image-grounded questions, yet they often struggle with complex queries requiring fine-grained visual details or extern…