1 paper
Shuai Zhao, Ruijie Quan, Linchao Zhu +1
Pre-trained vision-language models~(VLMs) are the de-facto foundation models for various downstream tasks. However, scene text recognition methods still prefer backbones pre-traine…