1 paper
Rui Tang, Wentao Yang, Peirong Zhang +4
Scene text spotting requires high-precision alignment between textual recognition and spatial localization. While visual-token grounding has emerged as a promising formulation for…