1 paper
Miguel Carvalho, Helder Dias, Bruno Martins
Vision-Language Models (VLMs) often struggle with tasks that require fine-grained image understanding, such as scene-text recognition or document analysis, due to perception limita…