1 paper
Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos +2
Generative Vision-Language Models (VLMs) perform well on multimodal reasoning, but how visual inputs are transformed to text remains poorly understood. Existing interpretability wo…