1 paper · 1 filter
Damiano Marsili, Aditya Mehta, Ryan Y. Lin +1
Vision-language models (VLMs) excel at broad visual understanding but remain coarse-grained, exhibit visual biases, and miss subtle visual details. Existing training corpora reinfo…