1 paper
Weile Gong, Zijian Lu, Mingcai Chen +3
Vision-language models (VLMs) enable flexible generative optical character recognition (OCR), while their open-ended decoders can expose wrong but fluent text with weak visual supp…