1 paper
Haoneng Lin, Cheng Xu, Jing Qin
Modern Vision-Language Models (VLMs) exhibit unprecedented capabilities in cross-modal semantic understanding between visual and textual modalities. Given the intrinsic need for mu…