1 paper
Weiqing Li, Jinyue Guo, Yaqi Wang +4
Visual-language models (VLMs) excel at data mappings, but real-world document heterogeneity and unstructuredness disrupt the consistency of cross-modal embeddings. Recent late-inte…