1 paper
Weile Gong, Yiping Zuo, Mingcai Chen +5
Vision-language models (VLMs) enable flexible generative optical character recognition (OCR), while their open-ended decoders can expose wrong but fluent text with weak visual supp…