1 paper
Xiaomei Zhang, Hanyu Zheng, Xiangyu Zhu +4
Large Vision-Language Models (LVLMs) have shown impressive capabilities across a range of tasks that integrate visual and textual understanding, such as image captioning and visual…