1 paper · 1 filter
Tong Zeng, Longfeng Wu, Liang Shi +2
Vision Large Language Models (VLLMs) have demonstrated impressive capabilities in general visual tasks such as image captioning and visual question answering. However, their effect…