3 papers
cs.CV2026
MuSViT: A Foundation Vision Model for Sheet Music Representation
Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez +4
Foundation models have transformed vision and language processing by providing rich, reusable representations that transfer across diverse tasks. Sheet music, as a visual encoding…
cs.AI2025
Spatial Context-based Self-Supervised Learning for Handwritten Text Recognition
Carlos Penarrubia, Carlos Garrido-Munoz, Jose J. Valero-Mas +1
Handwritten Text Recognition (HTR) is a relevant problem in computer vision, and implies unique challenges owing to its inherent variability and the rich contextualization required…
cs.CV2025
Self-Supervised Learning for Text Recognition: A Critical Survey
Carlos Penarrubia, Jose J. Valero-Mas, Jorge Calvo-Zaragoza
Text Recognition (TR) refers to the research area that focuses on retrieving textual information from images, a topic that has seen significant advancements in the last decade due…