2 papers
cs.CV2026
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
Miguel Carvalho, Helder Dias, Bruno Martins
Vision-Language Models (VLMs) often struggle with tasks that require fine-grained image understanding, such as scene-text recognition or document analysis, due to perception limita…
cs.CV2025
Efficient Architectures for High Resolution Vision-Language Models
Miguel Carvalho, Bruno Martins
Vision-Language Models (VLMs) have recently experienced significant advancements. However, challenges persist in the accurate recognition of fine details within high resolution ima…