1 paper
Henri Vanhuynegem, Weitao Xu, Yiran Shen +1
Vision-language models (VLMs) are becoming a practical backend for mobile visual question answering (VQA) systems, enabling smartphones and smart glasses to answer users' questions…