1 paper · 1 filter
Yubo Wang, Jianting Tang, Chaohu Liu +1
Large vision-language models (LVLMs) have demonstrated remarkable image understanding and dialogue capabilities, allowing them to handle a variety of visual question answering task…